{"as_of":"2026-08-09T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:989fd2e10a07ec7aefd3c1b40f13662a896eba65668e2ab08481d4783dc9d2e5","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:13:00.348063Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T22:47:51.676289Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:56:37.756820Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"cited_work":{"arxiv_id":"2507.08960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.08960","snapshot_observed_at":"2026-07-09T22:56:37.756820Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","venue":"cs.MA","work_id":"3334ec0c-766c-4fd6-8172-9142d4e80534","year":2025},"citing_paper":{"arxiv_id":"2606.04599","last_updated":"2026-06-03T08:38:14Z","snapshot_observed_at":"2026-08-08T00:44:18.329811Z","submitted_at":"2026-06-03T08:38:14Z","title":"Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T06:31:44.815249Z"},"links":{"cited_paper":"/paper/2507.08960","citing_paper":"/paper/2606.04599"},"observation_digest":"sha256:c590098354f24c390142b01dd74db518d7e71ed6aa3e7e22b2cec4a9bd617e1d","observation_id":"6fddc6f9-9dac-44d6-9fe6-1bb5a442007d","resolution":{"observed_at":"2026-07-02T07:56:47.554324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"cited_work":{"arxiv_id":"2507.08960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.08960","snapshot_observed_at":"2026-07-09T22:56:37.756820Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","venue":"cs.MA","work_id":"3334ec0c-766c-4fd6-8172-9142d4e80534","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-04T14:08:21.374754Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2507.08960","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:0521f03d62c0ec889092a82c3697e36fd6b017e5676a97a6408729f2bdd8eb57","observation_id":"4b4c0f79-3c6a-4168-bb90-8a1d61ec4fc3","resolution":{"observed_at":"2026-07-09T22:56:37.758040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.08960/citation-record","integrity":"/paper/2507.08960/integrity","json":"/paper/2507.08960/citation-record.json","paper":"/paper/2507.08960"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:58.005763Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.005763Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:c5aade4813253ebe3f03176c1c9c2b7a1790add9a8a9133b9bc8933f65a4e634","observation_id":"a4260ea4-7abf-4edc-b541-3b2a19422f04","resolution":{"observed_at":"2026-08-06T18:12:58.005763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T18:12:58.029371Z","title":"Hudson, Ehsan Adeli, Russ Altman, and et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.029371Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:096319f89ef0ca20c0015214e9a01297222e57e1bdb09cf8f2046b2140b1bd19","observation_id":"bde69cd1-60e0-4620-90ec-6d3d5dcda0ab","resolution":{"observed_at":"2026-08-06T18:12:58.029371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T18:12:58.051900Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, and et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.051900Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:359440ff751ca34a5b96f3b286b2a69b1e53d60d551e841e537a05738f42cbab","observation_id":"4a557c60-7ca1-4d22-b4a3-e3bae4c1f77a","resolution":{"observed_at":"2026-08-06T18:12:58.051900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-06T18:12:58.078990Z","title":"Chateval: Towards better llm-based evaluators through multi-agent debate.arXiv preprint arXiv:2308.07201, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.078990Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:c60315c11e2e7309da8d72a16807f3b1dd67bc02e8dab110528b6b7901090c13","observation_id":"a67cc61c-e0fe-4db0-8a0b-f7eff4fda5f7","resolution":{"observed_at":"2026-08-06T18:12:58.078990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06634","last_updated":"2024-01-19T07:16:21Z","snapshot_observed_at":"2026-08-09T16:50:19.443149Z","submitted_at":"2024-01-19T07:16:21Z","title":"SocraSynth: Multi-LLM Reasoning with Conditional Statistics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06634","snapshot_observed_at":"2026-08-06T18:12:58.107269Z","title":"Socrasynth: Multi-llm reasoning with conditional statistics.arXiv preprint arXiv:2402.06634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.107269Z"},"links":{"cited_paper":"/paper/2402.06634","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:518e86c6e56313579b3cd5d6f2432a9089511c7d4fa95a05feb4a19ab0c09a1f","observation_id":"12af781f-5054-43ed-9f3b-ab547c44287a","resolution":{"observed_at":"2026-08-06T18:12:58.107269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13007","last_updated":"2024-06-21T19:34:27Z","snapshot_observed_at":"2026-08-05T18:07:14.796740Z","submitted_at":"2023-09-22T17:12:45Z","title":"ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13007","snapshot_observed_at":"2026-08-06T18:12:58.136451Z","title":"Reconcile: Round-table conference improves reasoning via consensus among diverse llms.arXiv preprint arXiv:2309.13007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.136451Z"},"links":{"cited_paper":"/paper/2309.13007","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:906f66c01ac3dad3596037cd8cb11ecc796dd8aefafc23bd6d64f8470d732e16","observation_id":"a3fcc3d6-af83-4d07-9272-a7a0c28e18cb","resolution":{"observed_at":"2026-08-06T18:12:58.136451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05641","last_updated":"2026-05-30T02:07:53Z","snapshot_observed_at":"2026-08-07T17:21:28.934613Z","submitted_at":"2025-03-07T18:03:13Z","title":"Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05641","snapshot_observed_at":"2026-08-06T18:12:58.172268Z","title":"Symbolic mixture- of-experts: Adaptive skill-based routing for heterogeneous reasoning.arXiv preprint arXiv:2503.05641, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.172268Z"},"links":{"cited_paper":"/paper/2503.05641","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:cb2adaef221070cdbd30abc32345c4bddddd047afcef7bf21e4ce392f03c8397","observation_id":"f61326d0-7de9-4c33-887e-afeeaeab4906","resolution":{"observed_at":"2026-08-06T18:12:58.172268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17311","last_updated":"2023-11-29T02:07:09Z","snapshot_observed_at":"2026-08-08T00:18:31.827291Z","submitted_at":"2023-11-29T02:07:09Z","title":"Universal Self-Consistency for Large Language Model Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17311","snapshot_observed_at":"2026-08-06T18:12:58.200045Z","title":"Universal self-consistency for large language model generation.arXiv preprint arXiv:2311.17311, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.200045Z"},"links":{"cited_paper":"/paper/2311.17311","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:751a8f77e5967c6ea610d99a749c41917430709652416f69c1864047ee947d55","observation_id":"60908b6d-180d-4b21-a7e5-e772302339b5","resolution":{"observed_at":"2026-08-06T18:12:58.200045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16587","last_updated":"2024-10-02T13:22:27Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T14:38:24Z","title":"Cost-Effective Online Multi-LLM Selection with Versatile Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16587","snapshot_observed_at":"2026-08-06T18:12:58.230490Z","title":"Cost-effective online multi-llm selection with versatile reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.230490Z"},"links":{"cited_paper":"/paper/2405.16587","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:24e180bf219da15149647ade0db222ede3f914cdf57d1f84badedda9071fa5b7","observation_id":"5ef96167-bebf-4553-b765-e9a53fc887f1","resolution":{"observed_at":"2026-08-06T18:12:58.230490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:58.254960Z","title":"Improving factuality and reasoning in language models through multiagent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.254960Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:8619d76acb7ea8297b25c0fe5f25e368568b314ff250f9b4cc33b9d7faf4b83c","observation_id":"4048bd57-f74b-4197-8b87-0f335d1a653b","resolution":{"observed_at":"2026-08-06T18:12:58.254960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05047","last_updated":"2025-05-20T12:17:15Z","snapshot_observed_at":"2026-08-07T16:07:58.393635Z","submitted_at":"2025-04-07T13:17:52Z","title":"Debate Only When Necessary: Adaptive Multiagent Collaboration for Efficient LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05047","snapshot_observed_at":"2026-08-06T18:12:58.282695Z","title":"Debate only when necessary: Adaptive multiagent collaboration for efficient llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.282695Z"},"links":{"cited_paper":"/paper/2504.05047","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:553df34d79805e029cf5bb3d0eaa15a17229ad3be529d7f92dee8686fc3b03f4","observation_id":"1808ef03-445f-432a-b6b7-ec0674130b18","resolution":{"observed_at":"2026-08-06T18:12:58.282695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:03.315788Z","title":"Multi-llm debate: Framework, principals, and interventions.Advancesin Neural Information Processing Systems, 37:28938–28964, 2024","venue":null,"work_id":"87e45161-ae1a-44b0-aab6-0b21e4c559c6","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.316555Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:4732b1a9b23c2c4df6a0069f007d467dcef1aff738d5061a238f4c49755a1935","observation_id":"2add6b6c-d084-4bb7-91b5-4ef3434c6652","resolution":{"observed_at":"2026-08-06T18:13:03.384428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00053","last_updated":"2025-03-06T16:28:55Z","snapshot_observed_at":"2026-07-06T19:43:09.889618Z","submitted_at":"2024-10-30T19:09:02Z","title":"ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00053","snapshot_observed_at":"2026-08-06T18:12:58.333530Z","title":"Acc-collab: An actor-critic approach to multi-agent llm collaboration.arXiv preprint arXiv:2411.00053, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.333530Z"},"links":{"cited_paper":"/paper/2411.00053","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:e13b3d7979c152561e76e1e4034f33027f600537fde5143c16cf5780bbfd58d1","observation_id":"5cb5f25c-4895-4e1c-b7b0-8109771efe23","resolution":{"observed_at":"2026-08-06T18:12:58.333530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:03.140301Z","title":"Acc-collab: An actor-critic approach to multi-agent llm collaboration, 2024","venue":null,"work_id":"55a2828e-d068-4684-93e9-3c4b003a5cad","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.359750Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:dbce9dcf7b8a44d6751cb814e49fc402d97b0f21006746d9495d27dd0c4273b6","observation_id":"ceb1668a-586b-4453-b857-772546007899","resolution":{"observed_at":"2026-08-06T18:13:03.218235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00367","last_updated":"2024-07-01T01:34:09Z","snapshot_observed_at":"2026-08-05T02:20:52.778218Z","submitted_at":"2024-02-01T06:11:49Z","title":"Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00367","snapshot_observed_at":"2026-08-06T18:12:58.377961Z","title":"Don’t hallucinate, abstain: Identifying llm knowledge gaps via multi-llm collaboration.arXiv preprint arXiv:2402.00367, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.377961Z"},"links":{"cited_paper":"/paper/2402.00367","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:aef230b4ccedd93ef0323d67d1d735f2c92393b40b2602f9ff6be2fad318c18b","observation_id":"4c63ecf6-b762-4b69-a2a7-99d65e5c23fd","resolution":{"observed_at":"2026-08-06T18:12:58.377961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15951","last_updated":"2024-10-11T00:05:03Z","snapshot_observed_at":"2026-08-07T09:02:34.842175Z","submitted_at":"2024-06-22T22:07:40Z","title":"Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15951","snapshot_observed_at":"2026-08-06T18:12:58.398205Z","title":"Modular pluralism: Pluralistic alignment via multi-llm collaboration.arXiv preprint arXiv:2406.15951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.398205Z"},"links":{"cited_paper":"/paper/2406.15951","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:caeeccc4f708398a155215fcd19a62be5148a8855add1948a4f8037198f1118a","observation_id":"62cfc9c8-6a77-45ce-9136-e555f92dca6e","resolution":{"observed_at":"2026-08-06T18:12:58.398205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04506","last_updated":"2025-02-06T21:13:44Z","snapshot_observed_at":"2026-08-09T04:44:07.719948Z","submitted_at":"2025-02-06T21:13:44Z","title":"When One LLM Drools, Multi-LLM Collaboration Rules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04506","snapshot_observed_at":"2026-08-06T18:12:58.412984Z","title":"When one llm drools, multi-llm collaboration rules.arXiv preprint arXiv:2502.04506, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.412984Z"},"links":{"cited_paper":"/paper/2502.04506","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:53918711d56c1bf45f606e956e65b3b54e83fb7ced6df5253c0c0282b6f34857","observation_id":"0ab1ff3e-dcc9-448b-a654-72d8a3ac5e3a","resolution":{"observed_at":"2026-08-06T18:12:58.412984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:58.440669Z","title":"Heterogeneous swarms: Jointly optimizing model roles and weights for multi-llm systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.440669Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:37a21a7f6dc550f7bdc21959690cce6889a706bcfa365a964c0cf4d1fac1b974","observation_id":"98037f10-d385-4b10-96be-593571730124","resolution":{"observed_at":"2026-08-06T18:12:58.440669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:12:58.461508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.461508Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:d3b0178f3b2f7938264424eeb1c7629d8648e95682c483b08127a16376a07789","observation_id":"0c44c63f-9bf1-481e-9251-6cf1b33cc292","resolution":{"observed_at":"2026-08-06T18:12:58.461508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:12:58.485112Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.485112Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:e18913cfc2ab7efaa1c5f1ef1ed1415fb3e5e1f5032caddc38041e261d1ae605","observation_id":"de01ddc7-bbd2-4760-9bb2-e1a489f7016b","resolution":{"observed_at":"2026-08-06T18:12:58.485112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T18:12:58.517427Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.517427Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:2835fe07f637fa110e0cdff1a81160679bf52dc3cc21de79d4f3ee04613e9f4b","observation_id":"8bc2de8f-deff-42d0-a3d8-50001e383221","resolution":{"observed_at":"2026-08-06T18:12:58.517427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T18:12:58.548499Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.548499Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:6096cc7b399061b39bf54f3480445a41e4087b1b8f9261a35672bea3a765b631","observation_id":"d07b6f32-3df4-4d8e-80bf-56647a1cfb0d","resolution":{"observed_at":"2026-08-06T18:12:58.548499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-07-06T16:01:07.532053Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00352","snapshot_observed_at":"2026-08-06T18:12:58.583192Z","title":"Metagpt: Meta programming for a multi-agent collaborative framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.583192Z"},"links":{"cited_paper":"/paper/2308.00352","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:128ad6d777388c42416dc87e0d5a6f07c4d4d9941dd7a3e61dc85f3a4179c262","observation_id":"644f457c-aea3-4539-905c-75dd4b6023b2","resolution":{"observed_at":"2026-08-06T18:12:58.583192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T18:12:58.605891Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.arXiv preprint arXiv:2311.05232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.605891Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:944f1ebe3c15d8dc13b501ecb3050511dbc22a9bffd506cb0377fad77771dd98","observation_id":"597c834d-ee7b-4050-a9dc-87ef7e557153","resolution":{"observed_at":"2026-08-06T18:12:58.605891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.985773Z","title":"Ensemble learning for heterogeneous large language models with deep parallel collaboration.Advancesin Neural Information Processing Systems, 37:119838–119860, 2024","venue":null,"work_id":"dd9cd1ac-39d6-477d-aeba-405768c1872b","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.630989Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:dcb88653f4731cd6c310229ba5198d0ef75a725d2a05ba3cb93c1dd8cd3c27a5","observation_id":"99bc94e4-dcf3-486f-a5bd-b69e6a12db7c","resolution":{"observed_at":"2026-08-06T18:13:03.050076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:12:58.649279Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.649279Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:c49af490e27a35f7894e139f6cf0612d46c92ed5d220c28533662bb755b9bc33","observation_id":"f2669eb8-0f89-4653-984a-3a5a2f1c3b18","resolution":{"observed_at":"2026-08-06T18:12:58.649279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-05T15:27:19.717152Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-06T18:12:58.673023Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion.arXiv preprint arXiv:2306.02561, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.673023Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:983a9f5bd3d1db0ed3b6fb8f8d98e1fae01e37821315b628a3aeb00d05224682","observation_id":"908b419e-cb3d-45e8-b949-634ed9bfb66c","resolution":{"observed_at":"2026-08-06T18:12:58.673023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09772","last_updated":"2025-08-19T01:06:10Z","snapshot_observed_at":"2026-08-08T02:45:17.052821Z","submitted_at":"2025-04-14T00:27:45Z","title":"Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09772","snapshot_observed_at":"2026-08-06T18:12:58.703046Z","title":"Two heads are better than one: Test-time scaling of multi-agent collaborative reasoning.arXiv preprint arXiv:2504.09772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.703046Z"},"links":{"cited_paper":"/paper/2504.09772","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:fc324f056c1ff2fa9c79f6c8ab8a28b56fa84226ee2326c23d3b519916b5f63d","observation_id":"f49e5ddd-dd47-4ff4-bbfa-4f50ecc3c14d","resolution":{"observed_at":"2026-08-06T18:12:58.703046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06782","last_updated":"2024-07-25T23:32:21Z","snapshot_observed_at":"2026-08-06T16:12:39.214839Z","submitted_at":"2024-02-09T21:05:01Z","title":"Debating with More Persuasive LLMs Leads to More Truthful Answers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06782","snapshot_observed_at":"2026-08-06T18:12:58.734477Z","title":"Bowman, Tim Rocktäschel, and Ethan Perez","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.734477Z"},"links":{"cited_paper":"/paper/2402.06782","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:3396e6659cfbffe30121bcfc8f17da2045dc2fc4fed226d4c8ccc01073cdb8fe","observation_id":"12f9681d-b8c2-4344-b6c2-8546819eb797","resolution":{"observed_at":"2026-08-06T18:12:58.734477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-06T18:12:58.743208Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.743208Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:23b0256ff8bcf1c38829c1d5bbba013a6c06c9372f8cc6dfce55f753b4ed82c0","observation_id":"af1bd348-84c9-48e1-bb11-b38be3e4ea4f","resolution":{"observed_at":"2026-08-06T18:12:58.743208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03284","last_updated":"2024-11-05T17:33:39Z","snapshot_observed_at":"2026-08-04T23:07:40.014032Z","submitted_at":"2024-11-05T17:33:39Z","title":"SMoA: Improving Multi-agent Large Language Models with Sparse Mixture-of-Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03284","snapshot_observed_at":"2026-08-06T18:12:58.768620Z","title":"Smoa: Improving multi-agent large language models with sparse mixture-of-agents.arXiv preprint arXiv:2411.03284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.768620Z"},"links":{"cited_paper":"/paper/2411.03284","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:7ab72720695e26c55aefe93fd416a82886c0557bbf222d78791a3235ca934292","observation_id":"065edb2c-6337-4c27-b62e-6ffbc0d040f6","resolution":{"observed_at":"2026-08-06T18:12:58.768620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.19230","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:01.348845Z","title":"Two heads are better than one: Dual-model verbal reflection at inference-time.arXiv preprint arXiv:2502.19230, 2025","venue":null,"work_id":"bcb75cae-c486-41d5-8839-31d03bcdba12","year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.791281Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:4ee252ec696441898a5541c9a98814da695676d5898d711e06aaf2d10cdf19c5","observation_id":"b06ebd05-8852-4536-be17-d922927703b6","resolution":{"observed_at":"2026-08-06T18:13:01.369146Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02762","last_updated":"2024-12-31T06:54:19Z","snapshot_observed_at":"2026-07-06T15:50:53.355649Z","submitted_at":"2023-07-06T04:05:44Z","title":"PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02762","snapshot_observed_at":"2026-08-06T18:12:58.824124Z","title":"Prd: Peer rank and discussion improve large language model based evaluations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.824124Z"},"links":{"cited_paper":"/paper/2307.02762","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:398cb39fb2202307af0af3f0285556b0e86b643f15f9447b02f1457eb3e8450f","observation_id":"7db4046e-e50e-45f8-82f3-bc13de926a5a","resolution":{"observed_at":"2026-08-06T18:12:58.824124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11877","last_updated":"2025-01-21T04:11:59Z","snapshot_observed_at":"2026-07-06T20:23:40.374376Z","submitted_at":"2025-01-21T04:11:59Z","title":"From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11877","snapshot_observed_at":"2026-08-06T18:12:58.843340Z","title":"From drafts to answers: Unlocking llm potential via aggregation fine-tuning.arXiv preprint arXiv:2501.11877, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.843340Z"},"links":{"cited_paper":"/paper/2501.11877","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:1be0a58668587ab1b8e891ea1fbcc82d32f038f79296869f4f0651f5ee4ff32f","observation_id":"700d64f3-8551-4e27-b970-ba6321acecd4","resolution":{"observed_at":"2026-08-06T18:12:58.843340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11776","last_updated":"2024-06-17T17:33:09Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:33:09Z","title":"Improving Multi-Agent Debate with Sparse Communication Topology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11776","snapshot_observed_at":"2026-08-06T18:12:58.866755Z","title":"Improving multi-agent debate with sparse communication topology.arXiv preprint arXiv:2406.11776, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.866755Z"},"links":{"cited_paper":"/paper/2406.11776","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:f4c51115d9da75e4d545f85a5dac784e46da16ec035a9f11e0b3880c2a141bda","observation_id":"139d4ef8-f847-45a9-8eb3-94ccb2f62650","resolution":{"observed_at":"2026-08-06T18:12:58.866755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-01T16:20:31.337598Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-06T18:12:58.901843Z","title":"Encouraging divergent thinking in large language models through multi-agent debate.arXiv preprint arXiv:2305.19118, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.901843Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:fa4392e40c543f786147c57018b3edd11f054c1d31971dfeca07835d7bd4ba82","observation_id":"51167679-277f-4271-a834-e45d56d82b17","resolution":{"observed_at":"2026-08-06T18:12:58.901843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16129","last_updated":"2026-05-30T09:48:39Z","snapshot_observed_at":"2026-08-07T16:00:40.648265Z","submitted_at":"2025-04-21T07:03:54Z","title":"MARFT: Multi-Agent Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16129","snapshot_observed_at":"2026-08-06T18:12:58.937766Z","title":"Marft: Multi-agent reinforcement fine-tuning.arXiv preprint arXiv:2504.16129, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.937766Z"},"links":{"cited_paper":"/paper/2504.16129","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:c83f40d084b87baa0826b7531b940edb76349a5ccdf4b5c98125913f6b016430","observation_id":"a90916ee-2ddb-465e-bff1-f8c54a8c7fda","resolution":{"observed_at":"2026-08-06T18:12:58.937766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:58.973810Z","title":"Groupdebate: Enhancing the efficiency of multi-agent debate using group discussion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:58.973810Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:376353804bf4cac45d8eeed01a5e3e727f725622fd522d96e23de701d036b678","observation_id":"ed24df84-fe46-4fae-8838-6e7361642413","resolution":{"observed_at":"2026-08-06T18:12:58.973810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20252","last_updated":"2025-04-15T06:19:06Z","snapshot_observed_at":"2026-07-06T18:22:53.072592Z","submitted_at":"2024-05-30T17:05:45Z","title":"Towards Hierarchical Multi-Agent Workflows for Zero-Shot Prompt Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20252","snapshot_observed_at":"2026-08-06T18:12:59.009997Z","title":"Towards hierarchical multi-agent workflows for zero-shot prompt optimization.arXiv preprint arXiv:2405.20252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.009997Z"},"links":{"cited_paper":"/paper/2405.20252","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:6c5fa06c5201313b40d93c1bdf9672638ff295385e203fb9b2ac67b42e139505","observation_id":"341a368d-dece-4147-a542-a14dfe331d4a","resolution":{"observed_at":"2026-08-06T18:12:59.009997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T18:12:59.047193Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.047193Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:781c1056304f037e734f23fc95b5bd24472889658362efe5606555a77678b6f7","observation_id":"5dc73893-7337-4db7-ae30-b87f74102874","resolution":{"observed_at":"2026-08-06T18:12:59.047193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.878463Z","title":null,"venue":null,"work_id":"1a25c58f-fe78-42d9-b6a2-5cfd9855cff4","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.082303Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:7366d6ac1d08c569fb97d9b723738e423f9450c6fde280a5b6b3f43be457622a","observation_id":"9b776a90-25db-4ee1-a943-321d814100c8","resolution":{"observed_at":"2026-08-06T18:13:02.901335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:59.115363Z","title":"Self-refine: Iterative refinement with self-feedback.Advances in Neural Information Processing Systems, 36:46534–46594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.115363Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:24cf464c7e237df7ec0cc5be43c5d20506b1782891912dd02d8578d992294f02","observation_id":"88dd62b2-115b-4d69-99f7-df26b77abd66","resolution":{"observed_at":"2026-08-06T18:12:59.115363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08545","last_updated":"2025-06-12T13:33:52Z","snapshot_observed_at":"2026-08-09T19:17:43.719435Z","submitted_at":"2024-08-16T06:11:21Z","title":"SelectLLM: Query-Aware Efficient Selection Algorithm for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08545","snapshot_observed_at":"2026-08-06T18:12:59.145103Z","title":"Selectllm: Query-aware efficient selection algorithm for large language models.arXiv preprint arXiv:2408.08545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.145103Z"},"links":{"cited_paper":"/paper/2408.08545","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:a04a712a4de1c17f2621ca8b569fdeff00dd2ff0ed45ad884da66300f835dfe4","observation_id":"7c3f980c-8035-4390-b9e6-2d0ab0c2195e","resolution":{"observed_at":"2026-08-06T18:12:59.145103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.00000","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:01.026967Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models","venue":null,"work_id":"c7fe68ce-7d1d-43e5-ae90-e9048638493f","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.181998Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:0b96ffdc84c1fd1f56f11d0be0de1a29709b9ff185b7f1b21b5d448ff7785a4f","observation_id":"97d93bbb-9545-4b74-b30d-9c455ceb48e4","resolution":{"observed_at":"2026-08-06T18:13:01.062647Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:59.216898Z","title":"Motwani, Chandler Smith, Rocktim J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.216898Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:70870c31737473de9e9900e2e61cb4bde6b06403af2c4ee23d08e3829d7967b1","observation_id":"e7966f11-a285-4ac9-b61d-d8d1ac569a1b","resolution":{"observed_at":"2026-08-06T18:12:59.216898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18439","last_updated":"2025-07-12T20:13:27Z","snapshot_observed_at":"2026-08-07T17:49:20.599354Z","submitted_at":"2025-02-25T18:33:48Z","title":"MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18439","snapshot_observed_at":"2026-08-06T18:12:59.245532Z","title":"Maporl: Multi-agent post-co-training for collaborative large language models with reinforcement learning.arXiv preprint arXiv:2502.18439, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.245532Z"},"links":{"cited_paper":"/paper/2502.18439","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:f47950f4e2fe84081ed26d6a2c0a14590a6a917c5163f2b53e5cea0d7d1e2aeb","observation_id":"933c70b5-5273-4ec6-b898-39f5003ff99f","resolution":{"observed_at":"2026-08-06T18:12:59.245532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-06T18:12:59.282290Z","title":"O1 replication journey: A strategic progress report–part 1.arXiv preprint arXiv:2410.18982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.282290Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:b7cd539c35474bc1a986c3bf5d6e3644b901fe9e0b8192e6a90fa379b43e2837","observation_id":"fcab31e2-8508-4fe2-9861-2d58435f8910","resolution":{"observed_at":"2026-08-06T18:12:59.282290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12532","last_updated":"2024-07-17T13:14:00Z","snapshot_observed_at":"2026-07-06T18:47:47.021557Z","submitted_at":"2024-07-17T13:14:00Z","title":"Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12532","snapshot_observed_at":"2026-08-06T18:12:59.318146Z","title":"Towards collaborative intelligence: Propagating intentions and reasoning for multi-agent coordination with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.318146Z"},"links":{"cited_paper":"/paper/2407.12532","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:2181804186ecc0284c3d7a56ba70d4f52c430159c1625a902859e998acfc3095","observation_id":"6f94231f-a55b-4841-ab74-3b74cc6f3f99","resolution":{"observed_at":"2026-08-06T18:12:59.318146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T18:12:59.353123Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.353123Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:806306975290370d135f49440ec5823e5f07fdba47705060d73dc7073982a887","observation_id":"290f5497-d606-43da-af7d-05ffa0e50a00","resolution":{"observed_at":"2026-08-06T18:12:59.353123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T18:12:59.389070Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.389070Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:a2ef8d5646df69a4520b0895430d7f73e2985d496431b755145f38dbaf21505f","observation_id":"35070d5d-222d-4fbd-9321-603e556d56d2","resolution":{"observed_at":"2026-08-06T18:12:59.389070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17636","last_updated":"2025-08-25T06:11:33Z","snapshot_observed_at":"2026-07-06T19:57:28.746485Z","submitted_at":"2024-11-26T17:53:44Z","title":"MALMM: Multi-Agent Large Language Models for Zero-Shot Robotics Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17636","snapshot_observed_at":"2026-08-06T18:12:59.444849Z","title":"Malmm: Multi-agent large language models for zero-shot robotics manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.444849Z"},"links":{"cited_paper":"/paper/2411.17636","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:dc5a2d6e1aaf7297d34e428902bb785dbddef4142998a35c25a020a7c4a339aa","observation_id":"6f8fdf02-dab1-4ce9-8149-e33179bf2602","resolution":{"observed_at":"2026-08-06T18:12:59.444849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17371","last_updated":"2024-07-18T05:18:14Z","snapshot_observed_at":"2026-08-06T15:40:06.757182Z","submitted_at":"2023-11-29T05:54:41Z","title":"Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17371","snapshot_observed_at":"2026-08-06T18:12:59.473520Z","title":"Should we be going mad? a look at multi-agent debate strategies for llms.arXiv preprint arXiv:2311.17371, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.473520Z"},"links":{"cited_paper":"/paper/2311.17371","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:8ccd16605631254979a91f059c6f7de7323cb73143077f3b4c445ea22a3e56a8","observation_id":"afbc721e-c949-4498-8155-5eb6cdfc1040","resolution":{"observed_at":"2026-08-06T18:12:59.473520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-06T18:12:59.492882Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.492882Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:665786bff3c9c3a5598d1eeecfb49a25ad31da2b1de4ecb948da684ce186cc52","observation_id":"b08e34d0-5cb3-47a4-a98d-741b4b28bd2a","resolution":{"observed_at":"2026-08-06T18:12:59.492882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.780268Z","title":null,"venue":null,"work_id":"9aadba11-e88e-4921-90e2-4c2c271eb9cf","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.524423Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:97ff075d6b3619f4991b0eb3560e418c9382b07345595b2ce20a68aa78aad6dd","observation_id":"42978e99-da8c-48d2-b500-364fcb55df68","resolution":{"observed_at":"2026-08-06T18:13:02.819843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:12:59.592171Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.592171Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:8a32cbc36db1403f24ff77a7b442338e278327065c08366676ffd7acfc26b46d","observation_id":"ec833267-3708-47c0-93a1-ed34501fb33a","resolution":{"observed_at":"2026-08-06T18:12:59.592171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-07T17:09:42.953110Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-06T18:12:59.617501Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning.arXiv preprint arXiv:2503.09501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.617501Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:0fa73e0c6b31e1c3baa43e5886df791d23a17a54cc17b48fa34945c58a54c89d","observation_id":"bee4dd27-919b-47ab-a771-c8f20354d44b","resolution":{"observed_at":"2026-08-06T18:12:59.617501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04692","last_updated":"2024-06-07T07:04:10Z","snapshot_observed_at":"2026-08-07T21:51:22.136369Z","submitted_at":"2024-06-07T07:04:10Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04692","snapshot_observed_at":"2026-08-06T18:12:59.646978Z","title":"Mixture-of-agents enhances large language model capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.646978Z"},"links":{"cited_paper":"/paper/2406.04692","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:ef958d0319268a8d81a62d2ec0a13c28697a8e0540ed71d8edc6e83f0777a0e8","observation_id":"69d857ca-a367-4744-b812-1b5a3b746474","resolution":{"observed_at":"2026-08-06T18:12:59.646978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T18:12:59.678125Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.678125Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:2501dd85bee7ebf95b3529b450303c303b10ec68d6a7bad7c863c508bc97c0d0","observation_id":"456c1972-61bd-4e5d-8cb0-60ac7f7abce5","resolution":{"observed_at":"2026-08-06T18:12:59.678125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T18:12:59.703873Z","title":"Chain-of-thought prompting elicits reasoning in large language models.arXiv preprint arXiv:2201.11903, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.703873Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:5a4ec5069959afd08d8627c7c07c9af07fd95f17d8e588ec9b0d98961e65e77d","observation_id":"c6f7f492-6fe2-4edf-b028-048728c7dd10","resolution":{"observed_at":"2026-08-06T18:12:59.703873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-06T18:12:59.735760Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.735760Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:a92e589e33f1b962dd12c9cbad038114d0eefb4d775fb627254b49828fb9ae97","observation_id":"7ba63848-f0ec-402a-82db-1d4aac63c743","resolution":{"observed_at":"2026-08-06T18:12:59.735760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11595","last_updated":"2023-10-18T06:32:15Z","snapshot_observed_at":"2026-07-06T15:29:39.466936Z","submitted_at":"2023-05-19T11:15:33Z","title":"Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11595","snapshot_observed_at":"2026-08-06T18:12:59.763216Z","title":"Examining inter-consistency of large language models collaboration: An in-depth analysis via debate.arXiv preprint arXiv:2305.11595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.763216Z"},"links":{"cited_paper":"/paper/2305.11595","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:24a0daf50326cb7af02cb68787b547ab579809fb990333bf5a61330ef7a65430","observation_id":"a60e3e36-e01e-43d2-b319-9f9fcb5d416a","resolution":{"observed_at":"2026-08-06T18:12:59.763216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T18:12:59.793527Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.793527Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:5247348bd52c7722d6b77e2d789a9f38bc970adabf35fcaaa02cf0402890429d","observation_id":"8e1bdd83-af97-4041-b0e1-521d2b1b7820","resolution":{"observed_at":"2026-08-06T18:12:59.793527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18873","last_updated":"2025-02-26T06:31:04Z","snapshot_observed_at":"2026-08-07T17:48:04.353781Z","submitted_at":"2025-02-26T06:31:04Z","title":"Multi-LLM Collaborative Search for Complex Problem Solving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18873","snapshot_observed_at":"2026-08-06T18:12:59.822314Z","title":"Multi-llm collaborative search for complex problem solving.arXiv preprint arXiv:2502.18873, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.822314Z"},"links":{"cited_paper":"/paper/2502.18873","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:6c0857eff7cff6f19cfcd4f6a1b496ef57dd9ca1ba8c0b3afa5cd62ea243b66a","observation_id":"608823d2-2b24-4911-9c2b-a6368629f91a","resolution":{"observed_at":"2026-08-06T18:12:59.822314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00587","last_updated":"2025-05-29T18:55:08Z","snapshot_observed_at":"2026-08-07T16:18:01.999195Z","submitted_at":"2025-04-01T09:45:25Z","title":"AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00587","snapshot_observed_at":"2026-08-06T18:12:59.855011Z","title":"Agentnet: Decentralized evolutionary coordination for llm-based multi-agent systems.arXiv preprint arXiv:2504.00587, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.855011Z"},"links":{"cited_paper":"/paper/2504.00587","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:26c94c73e14fbd4fc0c89a664b575194039a279e3e7fc0a90ee9ff2948964553","observation_id":"eca49996-f6e0-415e-9532-a107d19292dd","resolution":{"observed_at":"2026-08-06T18:12:59.855011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16673","snapshot_observed_at":"2026-08-06T18:12:59.892203Z","title":"R1-sharevl: Incentivizing reasoning capability of multimodal large language models via share-grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.892203Z"},"links":{"cited_paper":"/paper/2505.16673","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:df99443572db1bf5811fff315ad95f4b5069c95936029e9197b7e7bba582e9af","observation_id":"2873cd1d-8021-4c09-a3b6-8f98b5d851d0","resolution":{"observed_at":"2026-08-06T18:12:59.892203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:12:59.917749Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.917749Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:3060604cd3b4b788d1c1723a0af8369849c7f1b67504f1c37dd4f14814e598e3","observation_id":"d1dd632c-f6eb-455b-9ab8-cdd6c3d1d633","resolution":{"observed_at":"2026-08-06T18:12:59.917749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16997","last_updated":"2025-05-22T17:56:39Z","snapshot_observed_at":"2026-08-09T17:43:21.620283Z","submitted_at":"2025-05-22T17:56:39Z","title":"X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16997","snapshot_observed_at":"2026-08-06T18:12:59.939425Z","title":"X-mas: Towards building multi-agent systems with heterogeneous llms.arXiv preprint arXiv:2505.16997, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.939425Z"},"links":{"cited_paper":"/paper/2505.16997","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:395fe78abbddc694adffda57c44a9fecb3314fcd245dbcef9184f0b76be2f9b4","observation_id":"3a0deef6-b5a5-46c0-893e-2f70b92aef8b","resolution":{"observed_at":"2026-08-06T18:12:59.939425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T18:12:59.958609Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.958609Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:6bb4ffc6b456bf81eddd3c0058c5621397ce0f92cd6e04f722a6a988ff694882","observation_id":"98fead6a-7a30-415d-8930-bc0ea65e6463","resolution":{"observed_at":"2026-08-06T18:12:59.958609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.635340Z","title":"Chain of agents: Large language models collaborating on long-context tasks.Advances in Neural Information Processing Systems, 37: 132208–132237, 2024","venue":null,"work_id":"0378b359-a0d1-48fa-86e8-9ba64873514a","year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.992721Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:2131370b03e67b0e1183cd073eac38409b6f698f45500ab62ecd960718cc88de","observation_id":"3afbd129-6a71-4eba-ac6e-3003fa257a68","resolution":{"observed_at":"2026-08-06T18:13:02.727265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-06T18:13:00.021058Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.021058Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:a7665ddbcf1ff63d995cbe042e02774aa66b0aa5e6b88a8c77fda0ce0f11f5bb","observation_id":"633bb555-fc2c-4003-9188-8f313ed67ce6","resolution":{"observed_at":"2026-08-06T18:13:00.021058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:13:00.055272Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.055272Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:056c638724fb84c4eb5af71a5bb200f3e134e15e304424141cd25b62bfc8f555","observation_id":"062c7dff-3ce0-47f1-a21d-290ef93ee002","resolution":{"observed_at":"2026-08-06T18:13:00.055272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.533573Z","title":null,"venue":null,"work_id":"ae4fc4d4-48ea-4f6d-a3f7-743453f4c81b","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.086857Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:7903fb193efaa0de802ec6152d89f500bc6899bcf255b67b3d09b1e9acc93c9d","observation_id":"0a111599-c2f5-4e98-98f3-4d3ed6bff955","resolution":{"observed_at":"2026-08-06T18:13:02.606895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.433653Z","title":"Address each question raised where relevant","venue":null,"work_id":"8e427cef-7fb5-4d90-a389-e7d1fc9f0245","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.122225Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:3a840e13a6499a9eac34a3dbafd67452b9e7346a0b3e0eb7e579a2028d67e459","observation_id":"1cbd8334-b5ec-46dd-9f99-393fcc307ac6","resolution":{"observed_at":"2026-08-06T18:13:02.462769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.384180Z","title":"Regardless of the approach, always conclude with: 25 Therefore, the final answer is: $\\boxed{[answer]}$","venue":null,"work_id":"3fbe0037-bab2-45ec-b379-91b77cfd9055","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.149962Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:458d57f33aeb0b9bc13a78789090c0c8dd7b8d4c115d8f9762ed996a752394e5","observation_id":"671f858a-d84e-4cca-bd6e-490bd5d1cb56","resolution":{"observed_at":"2026-08-06T18:13:02.402514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.196034Z","title":"- End the answer with: Therefore, the final answer is: $\\boxed{[answer]}$","venue":null,"work_id":"6ac246c6-c1b4-40cc-8cb6-b5c7a4a268cb","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.212428Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:394677199f32910204d13fd8d3c31da4075a60ab3556cc8535683cafb13de0b1","observation_id":"add2d73d-c7af-4113-8882-af81644c6a15","resolution":{"observed_at":"2026-08-06T18:13:02.222163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.102429Z","title":null,"venue":null,"work_id":"9d8e03ae-8d2a-44e2-9c27-e97503621ffd","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.238645Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:5923911aa4ebafb31d687b337e3964b96ae0296690b3b7bea42a1583288d3bd0","observation_id":"5d7ebf72-172c-4525-afe0-5910b2999433","resolution":{"observed_at":"2026-08-06T18:13:02.140011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.020424Z","title":"These should be carefully reviewed for mistakes","venue":null,"work_id":"074c17d5-6623-4653-9042-03de30518c00","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.261331Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:c765053ad03e0b777643e1782affe05196228bf6daa0cf6b58c47dbb77252b0b","observation_id":"53a71cad-ead2-4e6d-871b-a79d06efe8c2","resolution":{"observed_at":"2026-08-06T18:13:02.058682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:01.943014Z","title":"Wait, that doesn’t seem right","venue":null,"work_id":"245bd73f-b1f7-4715-85dd-9cf5fa84e8eb","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.284581Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:04013d29113bcda674b2c9f65c8770933f9d3e3a8c92d6ebd60fc0a38937017d","observation_id":"26db6557-6743-4503-9159-44a94183d0c3","resolution":{"observed_at":"2026-08-06T18:13:01.989643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:02.289952Z","title":null,"venue":null,"work_id":"f9c8344a-fd86-41e7-afce-63ab8365ad3e","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.320125Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:afa09d7237f2cb33784bc9cf1242ed40128a22cab742eadd50510835fc9acbdb","observation_id":"f1997a2b-2b83-42f9-9fda-666bbccea7ed","resolution":{"observed_at":"2026-08-06T18:13:02.326585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:13:01.876727Z","title":null,"venue":null,"work_id":"8400505f-a350-4643-bd29-f144ab2b0434","year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:13:00.348063Z"},"links":{"citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:7efd8a82cbb0ce3d49ac03fadd5a780269a4a1b11ff9c1df6b004b2051719d28","observation_id":"3cb29c6f-d52a-47f0-903e-2ddab44a79c9","resolution":{"observed_at":"2026-08-06T18:13:01.896301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T18:12:59.556457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:59.556457Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.08960"},"observation_digest":"sha256:6428ffb9752ca50210e6f110a4b84de0aaada58ff0f724c21c1311897799cdf3","observation_id":"20202767-143f-4d82-9975-74f515d63946","resolution":{"observed_at":"2026-08-06T18:12:59.556457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08960","last_updated":"2025-07-11T18:34:07Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-06T18:05:47.861506Z","submitted_at":"2025-07-11T18:34:07Z","title":"How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 2 inbound Pith citation observations for arXiv:2507.08960."}