{"as_of":"2026-08-10T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c933493781e4d73c84ed91b572d6dbd6bda42fdc69dfeeb411d9d58b59dd9515","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:02:45.317745Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:15:01.617748Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:33.482951Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-08-04T17:15:01.617748Z","title":"Revisiting multi-agent debate as test-time scaling: A systematic study of conditional effectiveness.arXiv preprint arXiv:2505.22960, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11035","last_updated":"2025-09-14T01:55:01Z","snapshot_observed_at":"2026-08-04T17:14:58.509975Z","submitted_at":"2025-09-14T01:55:01Z","title":"Free-MAD: Consensus-Free Multi-Agent Debate","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:01.617748Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2509.11035"},"observation_digest":"sha256:ce6ad91fdedf8e4b632678779f4c1b5d560885c0f2caced3012154a1693e8e84","observation_id":"2a2a4fa0-013f-4913-9e00-fa38553442cf","resolution":{"observed_at":"2026-08-04T17:15:01.617748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":"2505.22960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-07-04T04:09:33.482951Z","title":"arXiv preprint arXiv:2505.22960 , year=","venue":null,"work_id":"7e532c08-3b32-46b0-aa14-cda8a89affc6","year":null},"citing_paper":{"arxiv_id":"2605.01704","last_updated":"2026-05-05T16:21:16Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T04:12:21Z","title":"The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T15:52:43.274993Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2605.01704"},"observation_digest":"sha256:673a4f898b586402616ea64b5857fb74fec09bea6c72865ab5b9f04941190040","observation_id":"eb9a11b9-1f9e-449a-a1d0-539a9aea92c3","resolution":{"observed_at":"2026-05-11T09:41:03.999666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":"2505.22960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-07-04T04:09:33.482951Z","title":"arXiv preprint arXiv:2505.22960 , year=","venue":null,"work_id":"7e532c08-3b32-46b0-aa14-cda8a89affc6","year":null},"citing_paper":{"arxiv_id":"2606.00820","last_updated":"2026-05-30T17:41:11Z","snapshot_observed_at":"2026-07-06T23:41:30.158879Z","submitted_at":"2026-05-30T17:41:11Z","title":"Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T18:46:50.409655Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2606.00820"},"observation_digest":"sha256:3fbee0e3381991a740007bed01ef51fa9e5496545bd061f7ad0e2f8aa2496343","observation_id":"a4491ec6-89d0-45db-8255-668369926b0a","resolution":{"observed_at":"2026-06-28T19:52:35.927613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":"2505.22960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-07-04T04:09:33.482951Z","title":"arXiv preprint arXiv:2505.22960 , year=","venue":null,"work_id":"7e532c08-3b32-46b0-aa14-cda8a89affc6","year":null},"citing_paper":{"arxiv_id":"2606.02646","last_updated":"2026-05-31T16:19:54Z","snapshot_observed_at":"2026-08-05T03:02:24.343117Z","submitted_at":"2026-05-31T16:19:54Z","title":"The Ringelmann Effect in Multi-Agent LLM Systems: A Scaling Law for Effective Team Size","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T16:04:37.244398Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2606.02646"},"observation_digest":"sha256:30e83cabe08ae2fb42c99c975a91295eb2a4a7b5785736b8d1bf8454aac4602b","observation_id":"ad444918-9aa2-49bb-8725-23f1dae9f482","resolution":{"observed_at":"2026-07-01T21:56:15.586924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":"2505.22960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-07-04T04:09:33.482951Z","title":"arXiv preprint arXiv:2505.22960 , year=","venue":null,"work_id":"7e532c08-3b32-46b0-aa14-cda8a89affc6","year":null},"citing_paper":{"arxiv_id":"2606.02866","last_updated":"2026-06-01T20:29:47Z","snapshot_observed_at":"2026-08-09T19:09:15.706708Z","submitted_at":"2026-06-01T20:29:47Z","title":"When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T14:05:49.696342Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2606.02866"},"observation_digest":"sha256:7913fc1c256b8eafea84178ec4bd04201865a3b4fe463aaedfc3096009b30456","observation_id":"fb4142b4-7843-4053-a9fa-48531c202511","resolution":{"observed_at":"2026-07-01T23:36:23.855401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"cited_work":{"arxiv_id":"2505.22960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22960","snapshot_observed_at":"2026-07-04T04:09:33.482951Z","title":"arXiv preprint arXiv:2505.22960 , year=","venue":null,"work_id":"7e532c08-3b32-46b0-aa14-cda8a89affc6","year":null},"citing_paper":{"arxiv_id":"2606.19826","last_updated":"2026-06-18T06:06:28Z","snapshot_observed_at":"2026-08-02T23:54:57.895439Z","submitted_at":"2026-06-18T06:06:28Z","title":"Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T17:17:05.107942Z"},"links":{"cited_paper":"/paper/2505.22960","citing_paper":"/paper/2606.19826"},"observation_digest":"sha256:d4e1bedccdf902ddf3082b8e9035d11964de7da4146e2a7ab32f3293311eb4ce","observation_id":"b2ac482a-8485-4275-a117-6a62dac863b2","resolution":{"observed_at":"2026-07-04T04:09:33.490797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22960/citation-record","integrity":"/paper/2505.22960/integrity","json":"/paper/2505.22960/citation-record.json","paper":"/paper/2505.22960"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-10T02:45:59.371931Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T13:02:41.917221Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:41.917221Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:fb9d94ada40b4b57466f8ec25bdd762af481abd3464134616302bda2b731ded3","observation_id":"50165dfc-02ec-42c5-b4e2-4589e29b9d64","resolution":{"observed_at":"2026-08-07T13:02:41.917221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:48.917715Z","title":"AIME Problems and Solutions, 2025","venue":null,"work_id":"73d77035-22aa-4b97-a792-8e86aad9d0ee","year":2025},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:41.963916Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:2fef9cfde8be539601b20b03612b22c0a5b13d9bde3679838c4a1c2f4162152a","observation_id":"f7bcbcfb-5cb3-40a2-a7fc-a9c9d564f61c","resolution":{"observed_at":"2026-08-07T13:02:48.974827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T13:02:42.027532Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.027532Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:18c57cf54f8ba365f9e323a4ec02ee0fda58a9ef945c4240a2ec3dcee469d8a1","observation_id":"a3736bdf-ec6e-4833-ac82-cf84d1106980","resolution":{"observed_at":"2026-08-07T13:02:42.027532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-08-07T13:02:42.095621Z","title":"Why do multi- agent llm systems fail? arXiv preprint arXiv:2503.13657, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.095621Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:ea3ee949ce4140b8f1fe74a07ed962a597ebd49fa44ac2c586ad4784c21151b6","observation_id":"eb61c74b-3ac3-42f5-a418-7f9e56dd0bfa","resolution":{"observed_at":"2026-08-07T13:02:42.095621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:48.720842Z","title":"Reconcile: Round-table conference improves reasoning via consensus among diverse llms","venue":null,"work_id":"e9db76a6-4f30-448a-9acd-d503039d0443","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.153098Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:ab0d368cba67705493105fda6e112c7cb3e3b9fa76316cf1e03152171b5c90ef","observation_id":"7b8ba3e2-d821-4e8a-8e6a-24cf24afd817","resolution":{"observed_at":"2026-08-07T13:02:48.822189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05998","last_updated":"2024-01-11T15:57:38Z","snapshot_observed_at":"2026-07-06T17:14:19.624035Z","submitted_at":"2024-01-11T15:57:38Z","title":"Combating Adversarial Attacks with Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05998","snapshot_observed_at":"2026-08-07T13:02:42.213315Z","title":"Combating adversarial attacks with multi-agent debate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.213315Z"},"links":{"cited_paper":"/paper/2401.05998","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:4f7a9918fb29f3ea32f0b512d87e9d469e1045fc133bd0226f4a6a0437854009","observation_id":"24d4a73d-fccf-4b25-9b77-7150adbbbef6","resolution":{"observed_at":"2026-08-07T13:02:42.213315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12029","last_updated":"2026-08-03T22:16:33Z","snapshot_observed_at":"2026-08-09T12:08:41.859100Z","submitted_at":"2025-03-15T07:30:37Z","title":"Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12029","snapshot_observed_at":"2026-08-07T13:02:42.317472Z","title":"Is multi-agent debate (mad) the silver bullet? an empirical analysis of mad in code summarization and translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.317472Z"},"links":{"cited_paper":"/paper/2503.12029","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:89652b9f4eaf3e9c85a87edb9f34fd51f8aaa57ecf1e4c7d70a2048388b566c8","observation_id":"ef59e14e-97b5-44fc-83c7-1e88397b29d5","resolution":{"observed_at":"2026-08-07T13:02:42.317472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:02:42.391929Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.391929Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:11bf8781f5a8f604cbd0e5018abb7f912ce74a847814493fe0c6f1406c2f9432","observation_id":"0da4f06b-ae12-41e0-b5d5-8edcd3c37a3e","resolution":{"observed_at":"2026-08-07T13:02:42.391929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-08-08T01:21:39.731592Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-07T13:02:42.474919Z","title":"Multilingual jailbreak chal- lenges in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.474919Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:2154e96b09cb9528d83879d4197ae71092ec44170d1a156a95877752fbb69704","observation_id":"51a40f0e-8052-4add-906c-6f89b7618adc","resolution":{"observed_at":"2026-08-07T13:02:42.474919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:48.547548Z","title":"Improving factuality and reasoning in language models through multiagent debate","venue":null,"work_id":"b08be06c-f6d1-4811-b4c6-7e380587dd78","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.545982Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:31f8cc67a45613f3edfd34baeb7170b98e607ed2c184ffde0fbe13bbeb5978d0","observation_id":"157f11ae-88c1-4fce-959d-54bc007b4d75","resolution":{"observed_at":"2026-08-07T13:02:48.617588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:48.317884Z","title":"Multi-LLM debate: Framework, principals, and interventions","venue":null,"work_id":"a7c86a54-4ade-4516-a9d2-ad17cbb77ad7","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.619790Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:b83641153f8d8e5398e8185236854d49cd4c9f062acd6c121bb46ab1f80721fb","observation_id":"71e6a7c1-d19e-4968-9609-84f644783179","resolution":{"observed_at":"2026-08-07T13:02:48.448146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:02:42.686078Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.686078Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:f50f6d912b57bc7861bd466d1c7904b483ff37f1b8f8e3cf997bb220cb629e2c","observation_id":"9fa65451-ec23-49c2-b288-95a87761aeac","resolution":{"observed_at":"2026-08-07T13:02:42.686078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:42.781403Z","title":"An empirical analysis of compute-optimal large language model training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.781403Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:faf804c7aae5b5a7da2a7c1c8a5d1f8b73cc53d7199f1466eb2421180555d77a","observation_id":"28101e25-432d-44fc-bff6-3da30de146ba","resolution":{"observed_at":"2026-08-07T13:02:42.781403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:48.129538Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"93814b87-4578-493d-9586-07cc3ee93444","year":2020},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.875033Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:138221dc9449fabf82be2f9d3033b8fe22c81280a7c392df445d70bb5099a899","observation_id":"7cc32020-f4cf-4c49-9778-ccfe62600de2","resolution":{"observed_at":"2026-08-07T13:02:48.205048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-08T22:57:04.484148Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-07T13:02:42.962354Z","title":"Advancing language model reasoning through reinforcement learning and inference scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:42.962354Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:7e57c57679a7df054909cc908059fdbf7f01158bb79c587252331d893eb93bc4","observation_id":"91b8e223-e1c5-4e6c-bfcf-6fe735e1549b","resolution":{"observed_at":"2026-08-07T13:02:42.962354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:02:43.051383Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.051383Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:a4683841255a66f80c710b91086018dee01b8073240597301de8fb3327e5bcfe","observation_id":"11a8cff6-5d82-4963-a225-0b949976c3b5","resolution":{"observed_at":"2026-08-07T13:02:43.051383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T13:02:43.128633Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.128633Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:83ef3cf92a0595b36cd70018e30604255b106a7c7e4cd77a19947aabcb8a6ff8","observation_id":"cb22c870-4a60-4254-a16f-2110294f554c","resolution":{"observed_at":"2026-08-07T13:02:43.128633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15180","last_updated":"2024-02-27T01:39:20Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:22:24Z","title":"Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15180","snapshot_observed_at":"2026-08-07T13:02:43.211841Z","title":"Break the breakout: Reinventing lm defense against jailbreak attacks with self-refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.211841Z"},"links":{"cited_paper":"/paper/2402.15180","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:d779e35588d1eeb68ea75da74113031e73bce95c0d51114ab5d2a2f04c3377a4","observation_id":"b8eb9045-ce00-42b4-8d31-5e0cb97648ca","resolution":{"observed_at":"2026-08-07T13:02:43.211841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16377","last_updated":"2024-12-07T22:50:41Z","snapshot_observed_at":"2026-08-05T11:33:45.483902Z","submitted_at":"2024-10-21T18:00:06Z","title":"A Simple Model of Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16377","snapshot_observed_at":"2026-08-07T13:02:43.310559Z","title":"A simple model of inference scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.310559Z"},"links":{"cited_paper":"/paper/2410.16377","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:fa1ab4951a9fb8ffe6112d3cd6a29599da5aff9a58718d931601e199efbff8ae","observation_id":"f4ad240d-ab0d-47f3-89c7-cd5e72f2eb31","resolution":{"observed_at":"2026-08-07T13:02:43.310559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:43.390182Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.390182Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:0daa6fec6b15f0b0b5d107e651d491ee223649fb3a4dcee70c61bd6122eb5af2","observation_id":"caef8f91-cf52-4165-ae02-bf8114cb98fe","resolution":{"observed_at":"2026-08-07T13:02:43.390182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:47.931520Z","title":"Let’s verify step by step","venue":null,"work_id":"a95fcc6b-485b-4609-8f97-cb3ed55900f5","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.461797Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:00130f93eebac8c39b13cff21a75ba5065c4c62b7f2a44a204be03c5bf4cd621","observation_id":"9576c0c3-7c93-4a84-b6aa-2f631dc9a626","resolution":{"observed_at":"2026-08-07T13:02:47.995037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15028","last_updated":"2024-04-02T17:51:49Z","snapshot_observed_at":"2026-07-06T16:23:53.247204Z","submitted_at":"2023-09-26T15:57:57Z","title":"Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15028","snapshot_observed_at":"2026-08-07T13:02:43.514780Z","title":"Don’t throw away your value model! generating more preferable text with value-guided monte-carlo tree search decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.514780Z"},"links":{"cited_paper":"/paper/2309.15028","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:0fcfbe4c297beee067184c1fb2b8dbf93b2ef4f59c06d6a21ed96a774c9c1da6","observation_id":"991a5605-1452-4318-974a-5ebd74924ed7","resolution":{"observed_at":"2026-08-07T13:02:43.514780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:47.729610Z","title":"Breaking mental set to improve reasoning through diverse multi-agent debate","venue":null,"work_id":"fe7f2672-b230-496e-ac49-d7001915c138","year":2025},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.622627Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:509361007b4b0311cac20cefe9619258846c9098a2b1ea55518903c3c3249cca","observation_id":"6892ea3c-2473-4033-95cb-f5b7f5aa43d2","resolution":{"observed_at":"2026-08-07T13:02:47.806699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-08-07T13:02:43.689015Z","title":"Large language model guided tree-of-thought","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.689015Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:b7303d3be92674246841c5d157d2c3a102fd2a0e9f4dc27adaddbdeae0f04280","observation_id":"3f9e51d1-fd16-4550-bf19-7f0c113d4437","resolution":{"observed_at":"2026-08-07T13:02:43.689015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:47.499564Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"a2d7c34b-b03d-45bc-9355-5c5ca1f541b2","year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.809755Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:e2f926cd62848ebe605483f5d5b7423bd772d69f062df1ea5451c704e81b1e2e","observation_id":"eed94867-4db9-458d-afd1-9f9147eb6b66","resolution":{"observed_at":"2026-08-07T13:02:47.629374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:43.876587Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.876587Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:718d925641c88d1bce1eb0e8202d08676a124975f739094bb0a1615eed69c467","observation_id":"b05f67d7-eaa3-46a8-beea-016adb6c588f","resolution":{"observed_at":"2026-08-07T13:02:43.876587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:47.297296Z","title":"Should we be going mad? a look at multi-agent debate strategies for llms","venue":null,"work_id":"881ec8a5-90bf-4ec4-8640-3a0b2e3ed094","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:43.943342Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:7202e59845a08cf0de522b6c25b1f6eb97d6f1b1ed2e99c6b19ea10164da2456","observation_id":"b63599e5-2e99-4f04-8f44-090da8d8c1a9","resolution":{"observed_at":"2026-08-07T13:02:47.361841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T13:02:44.017112Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.017112Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:e279d1168bb63bd4eeb60133f7576e0596cff4fa2d3544aedd17437c9740d563","observation_id":"0447339c-e3d6-426b-8e53-d9e5eb0858da","resolution":{"observed_at":"2026-08-07T13:02:44.017112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T13:02:44.090457Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.090457Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:d43dcdf2fdfdfda35f3f4745bf3a7becaaf362782ae65b225ce289a332a93a1e","observation_id":"3649c79e-4a22-416f-8074-3946eb383c4b","resolution":{"observed_at":"2026-08-07T13:02:44.090457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T13:02:44.201364Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.201364Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:ea34e1b10fdf5989f19af33b02af60ce75b6f991e318f1cdbc09bb41c65bcbc7","observation_id":"4e7a4394-8d00-4085-a812-8ebbb20ad4f0","resolution":{"observed_at":"2026-08-07T13:02:44.201364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:44.323471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.323471Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:cc676373236382f302861c53d08970c56645c60f1ce75f5a56c5394db2e81c7b","observation_id":"43b7cf01-5e1c-41af-a77e-d9579df47a4a","resolution":{"observed_at":"2026-08-07T13:02:44.323471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:44.400972Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.400972Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:6b257f6fd97db6c29476480e5c2aaac74df20ce0e87f93a05bf6e6d1874a25e3","observation_id":"fe252aa3-127c-4995-a1a4-238077d50c11","resolution":{"observed_at":"2026-08-07T13:02:44.400972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:44.474136Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.474136Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:7577261a4250fcdff69b12a50b5e45b94938de33c2cce0b9383e4a281620e62a","observation_id":"771059ea-f15e-46f0-9a36-fc16aa64452d","resolution":{"observed_at":"2026-08-07T13:02:44.474136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-07T13:02:44.548349Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.548349Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:47f81183f6919b54ae845b2cafb874ca33b4c5435abd4d5477c94a57bd3054da","observation_id":"aec96bbc-035d-436b-b99f-9d49c1763475","resolution":{"observed_at":"2026-08-07T13:02:44.548349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:44.645060Z","title":"Self-evaluation guided beam search for reasoning.Advances in Neural Information Processing Systems, 36:41618–41650, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.645060Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:2db6dc3246710f34153683530e2eb7a1af6fe96cf27deaee352b19ed017428a6","observation_id":"712a0928-6fb9-4e55-9655-c1e19a20b67b","resolution":{"observed_at":"2026-08-07T13:02:44.645060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-07T13:02:44.713305Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.713305Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:9cd8433a556ba03919f44bfc75ef382a2fc4e911424aa8f093edf7d66edac48a","observation_id":"645603a2-e112-4f1b-98b8-34c3f1155150","resolution":{"observed_at":"2026-08-07T13:02:44.713305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:02:44.890454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:44.890454Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:2dce80dad554fd251357ad17b3bf84a40a6dc40801746a9da06e04d75412656b","observation_id":"86185fd4-e7d6-4378-96c3-c525adff82e7","resolution":{"observed_at":"2026-08-07T13:02:44.890454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:47.008156Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"4396436f-33ab-486c-a780-72e2637c7583","year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:45.024427Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:d218eb43858cb6ee989aa1ec0ef16b89f893a9796b9835718ed21792e5bd75e1","observation_id":"3f4324b8-7572-49a2-bbf9-870a6f3f9d87","resolution":{"observed_at":"2026-08-07T13:02:47.091050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:46.820037Z","title":"Csrt: Evaluation and analysis of llms using code-switching red-teaming dataset","venue":null,"work_id":"abac47ba-838f-4483-bc7a-dcc56f257f6c","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:45.101351Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:a312908a41f47d73eae1e257c0f2787fff7f46059b1951d1fb3869f1384505b6","observation_id":"0fc19b89-482a-495c-89d1-d4e62f7c113d","resolution":{"observed_at":"2026-08-07T13:02:46.896637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-07T06:17:52.920196Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-07T13:02:45.177061Z","title":"Autodefense: Multi- agent llm defense against jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:45.177061Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:7827abe8c1294c551744a5ab439655113692ffc93df9c9656b5c47c0001a2cb4","observation_id":"35c4c82a-a13b-483a-8835-afb609c51de4","resolution":{"observed_at":"2026-08-07T13:02:45.177061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-06T23:53:10.606737Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-07T13:02:45.265378Z","title":"user\": <str> of user prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:45.265378Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:0845da9c88dad26c0acfc0c58bae9e449e2e3f7d532a87179c8b85f986437140","observation_id":"5210efc6-e165-4d9a-829c-9dfb60662f0b","resolution":{"observed_at":"2026-08-07T13:02:45.265378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:46.510094Z","title":"I’m sorry, but I can’t assist with creating content that promotes hate, racism, or any form of discrimination","venue":null,"work_id":"ddb7904b-4e1b-4333-a130-bd093ca44529","year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:45.317745Z"},"links":{"citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:e81dbed4ae8534f99d72184f678136fa9a90684bc80caf6f80f28e3aa8ce5c79","observation_id":"3c178dd5-8622-43ff-a3da-77473e2e7b62","resolution":{"observed_at":"2026-08-07T13:02:46.675825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 6 inbound Pith citation observations for arXiv:2505.22960."}