{"as_of":"2026-08-09T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f8a7bf97fbb5df63e37ce1c2236fdc42a614f07c28a4e36bde1d4e92b800cf4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:25.898399Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:29:59.553004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-06T19:10:15.466826Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T06:58:54.921355Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2402.01680"},"observation_digest":"sha256:5cf3f9e4c0b279e2eac3edd55abb6357069f950062e00911a28e9d21a9e121b9","observation_id":"a1bdc827-7f92-4d8e-9400-42b3aba6e56d","resolution":{"observed_at":"2026-05-12T06:58:55.946367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:db2596b0618d6c633a6218c47fbcc4fcb1ebc742aa6d8d38d1957a19f63d343e","observation_id":"01b7f31b-91b7-4efb-aed8-cf060d0da3cb","resolution":{"observed_at":"2026-05-15T07:21:39.679132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T15:36:25.898399Z","title":"Avalonbench: Evaluating llms playing the game of avalon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.898399Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9765bdb5ff9f3d1e448f2c95b49be9317641da3add18be75a5aecd2df26b34ff","observation_id":"34943d93-bde3-4456-a1e2-d32ed692a665","resolution":{"observed_at":"2026-08-07T15:36:25.898399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T12:45:15.723111Z","title":"Avalonbench: Evaluating llms playing the game of avalon.arXiv preprint arXiv:2310.05036, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23713","last_updated":"2025-05-29T17:47:36Z","snapshot_observed_at":"2026-08-07T22:01:03.677076Z","submitted_at":"2025-05-29T17:47:36Z","title":"SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:15.723111Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2505.23713"},"observation_digest":"sha256:69514229d5757b2cb4765091e94697c06194ecf0b0df28cd950347905e54543d","observation_id":"160bc2c0-759b-4f4d-9147-24b6198c4e06","resolution":{"observed_at":"2026-08-07T12:45:15.723111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T12:09:02.061227Z","title":"Avalonbench: Evaluating llms playing the game of avalon.arXiv preprint arXiv:2310.05036, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.061227Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b80550b5f4493a3f4cc5581c51e7fcd7134128665e0158f9414ad9e4fe1ac552","observation_id":"f7e1c9e0-5ab3-441d-a0f4-7b0c98d53ea7","resolution":{"observed_at":"2026-08-07T12:09:02.061227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T04:34:37.906915Z","title":"Avalonbench: Evaluating llms playing the game of avalon,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10264","last_updated":"2025-06-12T01:16:34Z","snapshot_observed_at":"2026-08-08T15:38:22.407812Z","submitted_at":"2025-06-12T01:16:34Z","title":"WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:37.906915Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2506.10264"},"observation_digest":"sha256:f20321bc943a8d68fdede0d0de02e661745cffcad3a1f5558d849b354cafffe9","observation_id":"9c92b787-ddad-496b-83e6-a9517e2cd855","resolution":{"observed_at":"2026-08-07T04:34:37.906915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T01:06:46.441264Z","title":"and et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12012","last_updated":"2025-06-13T17:59:10Z","snapshot_observed_at":"2026-08-08T19:07:01.916168Z","submitted_at":"2025-06-13T17:59:10Z","title":"Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:46.441264Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2506.12012"},"observation_digest":"sha256:85a59ea432470ebd147bc8b591d43293f3772f7ffc2218cfa8e959742ffc40cc","observation_id":"ba95d4ab-71dc-4bd3-9418-a07a022a8bfc","resolution":{"observed_at":"2026-08-07T01:06:46.441264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2506.17788","last_updated":"2026-04-10T15:38:19Z","snapshot_observed_at":"2026-08-03T00:01:47.746581Z","submitted_at":"2025-06-21T18:45:28Z","title":"Bayesian Social Deduction with Graph-Informed Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T07:27:20.027179Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2506.17788"},"observation_digest":"sha256:d8433c24b6ac7e0bafb76b16b8252acfb8cb47a0dc864dc1262b60c438a2a5c1","observation_id":"290b5c75-e176-4b71-a860-a03d95f8ead9","resolution":{"observed_at":"2026-05-19T07:32:09.388738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-06T18:43:21.994778Z","title":"arXiv preprint arXiv:2310.05036 (2023) StarDojo 17","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07445","last_updated":"2026-06-28T16:34:15Z","snapshot_observed_at":"2026-08-09T11:23:03.691659Z","submitted_at":"2025-07-10T05:48:28Z","title":"StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:21.994778Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2507.07445"},"observation_digest":"sha256:c9a4c327d4ec4116a0371a1487946259d281d4a40457f92ebbcde162c5c7c6d7","observation_id":"6be7ce0b-2629-4ef1-9986-e986f01f6c38","resolution":{"observed_at":"2026-08-06T18:43:21.994778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-06T17:42:59.009288Z","title":"Avalonbench: Evaluating llms playing the game of avalon.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-07T20:29:46.771527Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:59.009288Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:4780d99aaf193b80653ba0c2626e359558a946a2ae39a719ee7f47485371a583","observation_id":"a715f859-e9e0-480d-ab7f-5e80e2d89da0","resolution":{"observed_at":"2026-08-06T17:42:59.009288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-05T20:30:29.614571Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10428","last_updated":"2025-08-14T07:58:01Z","snapshot_observed_at":"2026-08-07T15:44:58.934924Z","submitted_at":"2025-08-14T07:58:01Z","title":"SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:29.614571Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2508.10428"},"observation_digest":"sha256:6e93c8e3600cf03c43b9c0b4406ffa78417bc2de1e35a6cc09ffd8ad493868e2","observation_id":"505180f6-239f-4f55-a4c2-653ea13f0b53","resolution":{"observed_at":"2026-08-05T20:30:29.614571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.07003","last_updated":"2026-04-12T13:22:43Z","snapshot_observed_at":"2026-07-06T22:55:20.208897Z","submitted_at":"2026-04-08T12:20:06Z","title":"EmoMAS: Emotion-Aware Multi-Agent System for High-Stakes Edge-Deployable Negotiation with Bayesian Orchestration","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:11.659294Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.07003"},"observation_digest":"sha256:3b82a6de0b4de12dfecf681119ecc8570efb7819a0dc9d4503eae7bb8cc58129","observation_id":"ada10e2a-8fe7-4ff1-b0df-b473b714c77e","resolution":{"observed_at":"2026-05-11T06:25:58.378836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.13592","last_updated":"2026-04-16T06:54:57Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:55:41Z","title":"Foresight Optimization for Strategic Reasoning in Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:43.769341Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.13592"},"observation_digest":"sha256:5dd4c3f9c74eec283c066a556460e02d0442c5a60523d0050ecf0f276937797f","observation_id":"4f451fe1-7b98-41a2-a175-1233aff50a66","resolution":{"observed_at":"2026-05-10T13:45:27.784043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.16022","last_updated":"2026-04-17T12:51:46Z","snapshot_observed_at":"2026-07-06T23:03:26.308324Z","submitted_at":"2026-04-17T12:51:46Z","title":"SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T08:45:54.303143Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.16022"},"observation_digest":"sha256:1f990349651f1f849f91a82f9718d599ed21865ee96b190bb57139b96af56238","observation_id":"15e07cb4-a7dd-4665-a187-63299dd729a4","resolution":{"observed_at":"2026-05-10T08:48:01.645334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.20582","last_updated":"2026-04-22T14:00:56Z","snapshot_observed_at":"2026-07-31T18:28:35.664344Z","submitted_at":"2026-04-22T14:00:56Z","title":"Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T23:17:21.835439Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.20582"},"observation_digest":"sha256:e6da49ecaa57ee874ab033ef10376d04afde346a31fcab461d8b2e582a0a7f7f","observation_id":"03a35bec-b864-4d81-8aee-37c2234c7c85","resolution":{"observed_at":"2026-05-11T14:11:05.462688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.20987","last_updated":"2026-04-22T18:17:17Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T18:17:17Z","title":"Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:07.017420Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.20987"},"observation_digest":"sha256:cfc841630a07cca96a153c1477d5cd5bab011ea80513ccd0d611580a734da3bc","observation_id":"f5cdfb77-2a9a-482c-aca0-3a8724774c82","resolution":{"observed_at":"2026-05-10T00:14:46.439004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.22748","last_updated":"2026-06-08T04:24:27Z","snapshot_observed_at":"2026-08-02T10:58:24.119885Z","submitted_at":"2026-04-24T17:48:47Z","title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","version":1},"reference_index":236,"source":"arxiv_source","source_observed_at":"2026-05-08T12:02:07.027775Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.22748"},"observation_digest":"sha256:6b860f109710af0bc22e4336fafdf72ee24b2373ec68e068e8bfe621930dbee0","observation_id":"7cd5bd5e-3e33-434f-a1bb-d483448230ac","resolution":{"observed_at":"2026-05-11T19:26:07.961902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.22748","last_updated":"2026-06-08T04:24:27Z","snapshot_observed_at":"2026-08-02T10:58:24.119885Z","submitted_at":"2026-04-24T17:48:47Z","title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","version":2},"reference_index":236,"source":"arxiv_source","source_observed_at":"2026-07-04T17:29:43.764085Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.22748"},"observation_digest":"sha256:f257a1d7c87cd6c57413b6e8a29040d230ef9aab06f19a3e6bbcdea4c22a6786","observation_id":"159e147e-aa2e-4a70-ab3e-c5401ab93f10","resolution":{"observed_at":"2026-07-04T17:29:59.554653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2604.25088","last_updated":"2026-04-28T00:48:20Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T00:48:20Z","title":"Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-07T16:37:58.860183Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2604.25088"},"observation_digest":"sha256:23583dfd9dd7f76f350e92922dba0537406a8b4204243363ec6ca31088a5911f","observation_id":"06ce7a50-4e3e-4e57-b69e-629ab8feccdd","resolution":{"observed_at":"2026-05-11T23:36:36.092379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.13875","last_updated":"2026-05-08T06:56:35Z","snapshot_observed_at":"2026-08-02T22:27:33.584660Z","submitted_at":"2026-05-08T06:56:35Z","title":"Common-agency Games for Multi-Objective Test-Time Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T06:14:53.685486Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.13875"},"observation_digest":"sha256:67f10a33d7bce11e2ffa5697dcad7fd0f380ecade62fd5d9b108a01f72be8f37","observation_id":"5c10b9a0-6e5e-466e-ab34-de7982eb352a","resolution":{"observed_at":"2026-05-15T06:15:06.426047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.17510","last_updated":"2026-05-17T15:45:47Z","snapshot_observed_at":"2026-08-03T10:11:52.187850Z","submitted_at":"2026-05-17T15:45:47Z","title":"Scale-Dependent Collective Adaptation in Self-Amending LLM Societies: A Cross-Family Study of Emergent Governance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T22:29:17.058647Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.17510"},"observation_digest":"sha256:faccd72168064549b71d2917c643ee6006d6bc2924dfc484b64ad3005de37536","observation_id":"cb9cf47e-5ef0-4ca1-81e1-fd3c80f9aef2","resolution":{"observed_at":"2026-05-19T22:32:49.787160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.23238","last_updated":"2026-05-22T05:13:45Z","snapshot_observed_at":"2026-07-31T18:40:46.088078Z","submitted_at":"2026-05-22T05:13:45Z","title":"GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T04:41:35.532363Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.23238"},"observation_digest":"sha256:81f70aaf07602c4d2298461c6d3da15755635790efb93249e39df797a5aa4e02","observation_id":"f56577ed-154c-4d46-b975-29068346c485","resolution":{"observed_at":"2026-05-25T04:45:20.667414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.27068","last_updated":"2026-05-26T14:19:08Z","snapshot_observed_at":"2026-08-08T00:27:41.307742Z","submitted_at":"2026-05-26T14:19:08Z","title":"QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T17:59:51.871639Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.27068"},"observation_digest":"sha256:374d2d0c9986176e119209c9f1497093a3a4b16abfbb8e864229bfaf67e3e7e0","observation_id":"71342bf4-7e38-447d-a111-91474e50b450","resolution":{"observed_at":"2026-06-29T18:03:47.993143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:2703ec4bdb76ec6926358d243977cdacd7d5e1c5aa1334915efb7789fd8c8eb1","observation_id":"4ecfe833-ade7-4e2d-ab47-4aff26c4a9e3","resolution":{"observed_at":"2026-06-29T07:23:13.235012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.03544","last_updated":"2026-06-02T12:08:38Z","snapshot_observed_at":"2026-07-06T23:43:46.458792Z","submitted_at":"2026-06-02T12:08:38Z","title":"SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:02:25.870386Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.03544"},"observation_digest":"sha256:e3fe06bea007126ed8a714fc00eeeff193cfd41d1975c24d892940481dbf6d8e","observation_id":"4ac8eaba-a506-4471-8c2b-27a32a88dbc7","resolution":{"observed_at":"2026-07-02T03:26:29.552145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:283a79237d29d01a980a6a104c5279a03628826f92a9808d0758715cca8e41eb","observation_id":"9065fdc1-89b4-41b1-9c2e-eab7f132aa78","resolution":{"observed_at":"2026-07-03T10:58:02.906651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.18950","last_updated":"2026-06-18T08:25:27Z","snapshot_observed_at":"2026-08-07T06:04:46.021695Z","submitted_at":"2026-06-17T11:32:51Z","title":"RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:26.081166Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.18950"},"observation_digest":"sha256:e037b7626d3b368b04db0b43141b5887a630f3313ca65f703284f7f822c2dd7b","observation_id":"a91d1000-7fc6-44a7-ac9c-6a0fa701b1f9","resolution":{"observed_at":"2026-07-04T00:39:17.307387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.19308","last_updated":"2026-06-17T17:31:06Z","snapshot_observed_at":"2026-08-04T23:52:08.389322Z","submitted_at":"2026-06-17T17:31:06Z","title":"Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T20:57:49.840546Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.19308"},"observation_digest":"sha256:f5fe5d7f4a40bee96704ea5271905edbf54ed2791e9190acab7c8094ff886555","observation_id":"a92852ab-6d5e-4c1d-95c4-6f22d72fc59a","resolution":{"observed_at":"2026-07-04T00:49:18.518428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.19338","last_updated":"2026-06-17T17:59:34Z","snapshot_observed_at":"2026-07-06T23:54:37.596257Z","submitted_at":"2026-06-17T17:59:34Z","title":"Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T21:17:02.332687Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.19338"},"observation_digest":"sha256:ec7959758f129a0d642ff316c7ca47423830e216eec7a629f8bd73a70f7c02ef","observation_id":"f8a15a83-5e08-4b2b-86cc-0b4598343d03","resolution":{"observed_at":"2026-07-04T00:19:13.686463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2606.27397","last_updated":"2026-06-24T10:35:31Z","snapshot_observed_at":"2026-08-07T13:04:37.321863Z","submitted_at":"2026-06-24T10:35:31Z","title":"SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T01:56:22.856352Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2606.27397"},"observation_digest":"sha256:e1fd90260878d001be13e8d3513a88325f66a9663985ea2501563c8c64735a79","observation_id":"53f0b17e-7126-4545-ab2f-a1bb757a927a","resolution":{"observed_at":"2026-07-01T18:35:58.036755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-14T10:15:59.479435Z","title":"2310.05036 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10645","last_updated":"2026-07-18T17:54:54Z","snapshot_observed_at":"2026-08-08T07:16:34.332077Z","submitted_at":"2026-07-12T08:20:52Z","title":"MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T10:15:59.479435Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2607.10645"},"observation_digest":"sha256:faabe7e4e60c61ea46b4df0c351f476719c91450968b1f325a4bbb366d597b36","observation_id":"6d241ef8-b7ed-47a5-8d3a-9c8ee46715cb","resolution":{"observed_at":"2026-07-14T10:15:59.479435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-02T07:15:00.001267Z","title":"2310.05036 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10645","last_updated":"2026-07-18T17:54:54Z","snapshot_observed_at":"2026-08-08T07:16:34.332077Z","submitted_at":"2026-07-12T08:20:52Z","title":"MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:15:00.001267Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2607.10645"},"observation_digest":"sha256:9a6f9160af91b0f6fa523f303ef34fba391196f13614cf026594a658a50ac81b","observation_id":"ab7c3c69-23ed-407f-b4ad-8852f0751c99","resolution":{"observed_at":"2026-08-02T07:15:00.001267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-01T00:51:15.570493Z","title":"arXiv preprint arXiv:2310.05036 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26120","last_updated":"2026-07-28T17:48:54Z","snapshot_observed_at":"2026-08-07T12:54:18.789385Z","submitted_at":"2026-07-28T17:48:54Z","title":"Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T00:51:15.570493Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2607.26120"},"observation_digest":"sha256:2e209ca6afe78add3c7c42bfd36090d778cb916db5d8fbff05ba407d53f8aab1","observation_id":"18585a22-5ed8-4c90-bf85-0990a2baedef","resolution":{"observed_at":"2026-08-01T00:51:15.570493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-31T16:28:48.692047Z","title":"Gionnieve Lim, Bryan Chen Zhengyu Tan, Kellie Yu Hui Sim, Weiyan Shi, Ming Hui Chew, Ming Shan Hee, Roy Ka-Wei Lee, Simon T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28146","last_updated":"2026-07-30T12:54:17Z","snapshot_observed_at":"2026-08-07T22:08:42.725436Z","submitted_at":"2026-07-30T12:54:17Z","title":"Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T16:28:48.692047Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2607.28146"},"observation_digest":"sha256:4457a05871a09daa1f1160dbca041fee3e81614667ca9ec833087fe1c8b3ac4d","observation_id":"086d3904-79f4-4f93-b6f9-b7db7a39c1c0","resolution":{"observed_at":"2026-07-31T16:28:48.692047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.05036/citation-record","integrity":"/paper/2310.05036/integrity","json":"/paper/2310.05036/citation-record.json","paper":"/paper/2310.05036"},"outbound":[],"paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2310.05036."}