{"as_of":"2026-08-17T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:713c4277a81fa7064b047e6875ffae2ef6e76e587e04cc4f244f3281c12a56f8","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:50:28.171568Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:50:30.476760Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T08:58:13.216074Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14520","snapshot_observed_at":"2026-08-15T15:50:30.476760Z","title":"Meta-thinking in llms via multi-agent reinforcement learning: A survey.arXiv preprint arXiv:2504.14520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.476760Z"},"links":{"cited_paper":"/paper/2504.14520","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:136f569b12d56504c288007d4f2c4a4ae8fc3b48bd5fcd67e6d731b52033d65d","observation_id":"d795cdaf-31c7-4e31-b172-fad1c89479b0","resolution":{"observed_at":"2026-08-15T15:50:30.476760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2504.14520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14520","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-thinking in llms via multi-agent reinforcement learning: A survey","venue":null,"work_id":"77fe3e59-71e4-4bc4-bf56-0fe6b0f04776","year":2025},"citing_paper":{"arxiv_id":"2604.15972","last_updated":"2026-04-17T11:36:20Z","snapshot_observed_at":"2026-08-13T01:52:52.370192Z","submitted_at":"2026-04-17T11:36:20Z","title":"Weak-Link Optimization for Multi-Agent Reasoning and Collaboration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T08:53:03.420926Z"},"links":{"cited_paper":"/paper/2504.14520","citing_paper":"/paper/2604.15972"},"observation_digest":"sha256:319dad61c8e2693f84db87b948ccff4ac1983235f321906ad0bd1983682c7dd3","observation_id":"594d600c-b10e-46ab-b09a-d5a8219ea514","resolution":{"observed_at":"2026-05-10T08:58:13.218271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2504.14520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14520","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-thinking in llms via multi-agent reinforcement learning: A survey","venue":null,"work_id":"77fe3e59-71e4-4bc4-bf56-0fe6b0f04776","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2504.14520","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:3e9596084b805bcacfa4f1a7b28c34953ea51a7e456655ea7a1248560546eed5","observation_id":"0b30f91a-1da6-43b0-b8d6-2a8131d40932","resolution":{"observed_at":"2026-05-10T08:12:25.995829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2504.14520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14520","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-thinking in llms via multi-agent reinforcement learning: A survey","venue":null,"work_id":"77fe3e59-71e4-4bc4-bf56-0fe6b0f04776","year":2025},"citing_paper":{"arxiv_id":"2604.20140","last_updated":"2026-04-22T03:08:30Z","snapshot_observed_at":"2026-08-13T04:34:41.287778Z","submitted_at":"2026-04-22T03:08:30Z","title":"HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:37.506096Z"},"links":{"cited_paper":"/paper/2504.14520","citing_paper":"/paper/2604.20140"},"observation_digest":"sha256:c18d9782f4f85a1bf358f7a228be26f5faa0f68a63df45efd22f4381663ca876","observation_id":"c3a4fb96-ec94-4311-8ce7-2106133bb173","resolution":{"observed_at":"2026-05-10T00:54:48.570592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14520/citation-record","integrity":"/paper/2504.14520/integrity","json":"/paper/2504.14520/citation-record.json","paper":"/paper/2504.14520"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.711553Z","title":"Is creativity without intelligence possible? a necessary condition analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.711553Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:6b916d58da156ba93594b98afb80f3da93fedcd50ca32662958d740b49634cbd","observation_id":"1e6c8538-f2b3-46ea-9dbb-bbd4b8ec88a8","resolution":{"observed_at":"2026-08-16T11:50:27.711553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10630","last_updated":"2024-10-14T15:38:56Z","snapshot_observed_at":"2026-08-16T13:09:33.655948Z","submitted_at":"2024-10-14T15:38:56Z","title":"Thinking LLMs: General Instruction Following with Thought Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10630","snapshot_observed_at":"2026-08-16T11:50:27.716555Z","title":"Thinking llms: General instruction following with thought generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.716555Z"},"links":{"cited_paper":"/paper/2410.10630","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:3857c9355005ad380a631f1b541ecbb7ad653f19d2bf14a71591c122e7bd7e85","observation_id":"d882530a-a2bd-4cb8-9c77-a800c9bc2dc6","resolution":{"observed_at":"2026-08-16T11:50:27.716555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00125","last_updated":"2025-03-31T18:19:41Z","snapshot_observed_at":"2026-08-16T12:45:12.855025Z","submitted_at":"2025-03-31T18:19:41Z","title":"LLMs for Explainable AI: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00125","snapshot_observed_at":"2026-08-16T11:50:27.721261Z","title":"Llms for explainable ai: A compre- hensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.721261Z"},"links":{"cited_paper":"/paper/2504.00125","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:5c30580b738b4ce47e353a306a3da901c4b955361cc4ed3778465062ee596ea2","observation_id":"096de597-32ce-4b2d-9bc7-38d428171b72","resolution":{"observed_at":"2026-08-16T11:50:27.721261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.726139Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.726139Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:a0191341261aa057d782564128ff2f8c6f64c981e7547f66dc4c5d69cae4035f","observation_id":"1dd879aa-9cc7-4df7-a203-09ba2a5c835b","resolution":{"observed_at":"2026-08-16T11:50:27.726139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-16T13:17:24.872479Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-16T11:50:27.730766Z","title":"To cot or not to cot? chain-of-thought helps mainly on math and symbolic reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.730766Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:1d51f63fdad6ae3ec42f9131732597448dcd21bf480da18c35df8a0bfd4ae47f","observation_id":"42affbab-670e-46d7-b223-df2d468a7cde","resolution":{"observed_at":"2026-08-16T11:50:27.730766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07670","last_updated":"2025-03-09T07:11:48Z","snapshot_observed_at":"2026-08-16T12:51:50.472541Z","submitted_at":"2025-03-09T07:11:48Z","title":"Retrieval Augmented Generation with Multi-Modal LLM Framework for Wireless Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07670","snapshot_observed_at":"2026-08-16T11:50:27.735660Z","title":"Retrieval augmented generation with multi-modal llm framework for wireless environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.735660Z"},"links":{"cited_paper":"/paper/2503.07670","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2c24ff01488341ff4372d947de1145c68f2c7e2a8f0ed0887b2d9a33c8a9ba5a","observation_id":"71dc5145-b59d-4802-a989-688a1b3bb8a9","resolution":{"observed_at":"2026-08-16T11:50:27.735660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.741423Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.741423Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:f3f4b9908f9134d9622734c03c584b6c8d6b73f79abf1fda62385eb1fd880872","observation_id":"154bcae4-8dbc-42c0-a481-b5108176eb91","resolution":{"observed_at":"2026-08-16T11:50:27.741423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.745978Z","title":"Assessing llms for high stakes applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.745978Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:8fe2f52c6e0c5f58b7f07abd3d842ed479808d4e55b2893eaddab53f144539e9","observation_id":"c9515db6-f872-4c55-b877-87afbf98d45d","resolution":{"observed_at":"2026-08-16T11:50:27.745978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-08-16T12:38:46.158503Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-16T11:50:27.750368Z","title":"Siren’s song in the ai ocean: A survey on hal- lucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.750368Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b2acc7e2d60c48ece980c86c2e10c1c95fc254101b76a3d8ffc6d63c5434fcdf","observation_id":"b65b79f8-6cb2-43d9-945e-cac4f7eaac68","resolution":{"observed_at":"2026-08-16T11:50:27.750368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.755117Z","title":"A review of methods for alleviating hallucination issues in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.755117Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:222b3f923dad0552ac9949d6168caf98bc6ee7ea372d44208c875c0c9bc59109","observation_id":"44773207-9de3-461f-a6dc-b6efd21e2ec9","resolution":{"observed_at":"2026-08-16T11:50:27.755117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-16T14:54:43.078629Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-16T11:50:27.759524Z","title":"A long way to go: Inves- tigating length correlations in rlhf,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.759524Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2e236fb1a54ad3b938de988e5d9c7a0928d86d803767e622fa655c834b04112d","observation_id":"d7c67a13-6121-40a0-80a4-fe585826d8a8","resolution":{"observed_at":"2026-08-16T11:50:27.759524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.764165Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.764165Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d11f42d7fb95d679ec7a458a4f09e9a8863077174718c73957d6bea2c986a056","observation_id":"1b9787b9-0b1f-4fe6-ab13-7722ba6d720b","resolution":{"observed_at":"2026-08-16T11:50:27.764165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T11:50:27.768476Z","title":"Continuous control with deep reinforce- ment learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.768476Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2d7ccf38c323bcb1fabf1fc6906366e4cd5b3bfb766ac8cb7976e6a62c52ec2f","observation_id":"6c73aaa1-87b3-4b79-ab48-28cf63316f5a","resolution":{"observed_at":"2026-08-16T11:50:27.768476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:50:27.773074Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.773074Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9c3c48e5adf08b9c5c0a108e6326fe4e2d5b811dd88f7e125b86e4fe10aeb2af","observation_id":"6e385f08-7479-43b8-a3d1-aed2a29b7ed7","resolution":{"observed_at":"2026-08-16T11:50:27.773074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.777510Z","title":"Mixcl: Mixed contrastive learning for relation extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.777510Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:700bdc08592a7dc9edb45c35d54e242fbb84077ed13aefcbc5f93bfd2be072d6","observation_id":"427aca7f-f001-4028-8712-34c0f4cc7b30","resolution":{"observed_at":"2026-08-16T11:50:27.777510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08455","last_updated":"2021-09-14T12:00:18Z","snapshot_observed_at":"2026-08-16T18:30:56.307327Z","submitted_at":"2021-04-17T05:23:44Z","title":"Neural Path Hunter: Reducing Hallucination in Dialogue Systems via Path Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08455","snapshot_observed_at":"2026-08-16T11:50:27.781720Z","title":"Neural path hunter: Reducing hallucination in dialogue systems via path grounding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.781720Z"},"links":{"cited_paper":"/paper/2104.08455","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:e2115c6b10e0e2977f531ed7011620defc90ff2a0e2be70240e7a47631f58f5b","observation_id":"051a03b3-4b26-40c7-a85c-9253f5c82c3a","resolution":{"observed_at":"2026-08-16T11:50:27.781720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.786475Z","title":"Mitigating large language model hallucinations via autonomous knowledge graph- based retrofitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.786475Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:e8b692ae86165e1bca8c2329d27b5e979214a09ef377363227d902771a4e6e25","observation_id":"abe910a9-7111-4836-a2d8-1d669142b0d8","resolution":{"observed_at":"2026-08-16T11:50:27.786475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03987","last_updated":"2023-08-12T14:57:37Z","snapshot_observed_at":"2026-08-16T15:17:45.710645Z","submitted_at":"2023-07-08T14:25:57Z","title":"A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of LLMs by Validating Low-Confidence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03987","snapshot_observed_at":"2026-08-16T11:50:27.791031Z","title":"A stitch in time saves nine: Detecting and mitigating hallucinations of llms by vali- dating low-confidence generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.791031Z"},"links":{"cited_paper":"/paper/2307.03987","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:096cb7f9efff5db606aa75761909f8f351228b1831b8b590de98a8973029c6b9","observation_id":"6cfc1447-a83b-465b-bcfa-f0b303f4ff94","resolution":{"observed_at":"2026-08-16T11:50:27.791031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01061","last_updated":"2024-02-24T03:03:12Z","snapshot_observed_at":"2026-08-16T14:55:55.951126Z","submitted_at":"2023-10-02T10:14:43Z","title":"Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01061","snapshot_observed_at":"2026-08-16T11:50:27.795731Z","title":"Reasoning on graphs: Faithful and interpretable large language model reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.795731Z"},"links":{"cited_paper":"/paper/2310.01061","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9f8446f5dd972b2ce5a9dfd1ec288414527d5dba41273bdb3dcdc9f85f84719b","observation_id":"18d80309-24b0-459c-9331-679058f8a2bd","resolution":{"observed_at":"2026-08-16T11:50:27.795731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-16T11:50:27.800254Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.800254Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2938edd795e6444393374e35591ced658d8feec06d8e76248dd96fe97fe1b0a1","observation_id":"f1e05a96-e1a7-42d2-a8b3-725ffe62fe8a","resolution":{"observed_at":"2026-08-16T11:50:27.800254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-16T11:50:27.804684Z","title":"Selfcheckgpt: Zero-resource black-box hallucination detection for generative large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.804684Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0c69b2759ca2c2520ff62fca4e8a3372ca86c77753b68a5f8df76594ec636637","observation_id":"b177ac6c-635b-4070-9139-0957ba51eeec","resolution":{"observed_at":"2026-08-16T11:50:27.804684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11495","last_updated":"2023-09-25T15:25:49Z","snapshot_observed_at":"2026-08-12T01:35:36.884518Z","submitted_at":"2023-09-20T17:50:55Z","title":"Chain-of-Verification Reduces Hallucination in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11495","snapshot_observed_at":"2026-08-16T11:50:27.809408Z","title":"Chain-of-verification reduces hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.809408Z"},"links":{"cited_paper":"/paper/2309.11495","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:41eaf31478290d3399812cb4c7a2c1988802bb7c60c301ae6faaf5f85a9edca9","observation_id":"03780251-b86b-445b-b0fd-433f624b25a3","resolution":{"observed_at":"2026-08-16T11:50:27.809408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09267","last_updated":"2024-06-11T12:22:14Z","snapshot_observed_at":"2026-08-16T14:18:36.464295Z","submitted_at":"2024-02-14T15:52:42Z","title":"Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09267","snapshot_observed_at":"2026-08-16T11:50:27.814258Z","title":"Self-alignment for factuality: Mitigating hallucinations in llms via self-evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.814258Z"},"links":{"cited_paper":"/paper/2402.09267","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:de2b99a8f9a9ef610690489b0f8954d4f0a33d60f0827916c21055090e608d7e","observation_id":"eb624d59-d1c8-426d-8410-550fd622c07e","resolution":{"observed_at":"2026-08-16T11:50:27.814258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15852","last_updated":"2024-03-15T21:04:34Z","snapshot_observed_at":"2026-08-16T15:29:49.848201Z","submitted_at":"2023-05-25T08:43:46Z","title":"Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15852","snapshot_observed_at":"2026-08-16T11:50:27.818881Z","title":"Self-contradictory hallucinations of large language models: Evaluation, detection and mitigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.818881Z"},"links":{"cited_paper":"/paper/2305.15852","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:79cb4e9b3004c12d5b0407c7cea62eed5e3ced30a1875c90f15f7b55ad746727","observation_id":"fa6d9464-ecb5-4ab5-8836-a1589b16fbc5","resolution":{"observed_at":"2026-08-16T11:50:27.818881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09044","last_updated":"2023-10-13T12:12:34Z","snapshot_observed_at":"2026-08-16T14:52:22.698834Z","submitted_at":"2023-10-13T12:12:34Z","title":"KCTS: Knowledge-Constrained Tree Search Decoding with Token-Level Hallucination Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09044","snapshot_observed_at":"2026-08-16T11:50:27.823504Z","title":"Kcts: knowledge-constrained tree search decoding with token-level hallucination detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.823504Z"},"links":{"cited_paper":"/paper/2310.09044","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:43ee81a07c9597ed35fd452bf2359f4116b45e01bdd24b98d2cef9a0b6d05152","observation_id":"394cbf54-979d-498f-b796-80434bc5d06a","resolution":{"observed_at":"2026-08-16T11:50:27.823504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.828277Z","title":"Inference- time intervention: Eliciting truthful answers from a language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.828277Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:859cf96bba14ecda8f0cec93a596bb1c0036407b224ceab495609c62d31f0d7e","observation_id":"f8a06022-c61e-49da-b9bb-3b649acac5ac","resolution":{"observed_at":"2026-08-16T11:50:27.828277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-16T11:50:27.832665Z","title":"Decoding by contrasting layers improves factuality in large language models. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.832665Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:418fac4ab0b304da2d67e0b77286721e1fbff040d91934755ba0b7ac292a2363","observation_id":"66daf7b3-f725-4b40-81f1-135f56b87328","resolution":{"observed_at":"2026-08-16T11:50:27.832665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.837478Z","title":"Self-refine: Iter- ative refinement with self-feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.837478Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d7707fffa8bf96f2f166e4ba7e796d17963d311cac64c5ed0a9484be7224d97a","observation_id":"11b83328-ce46-42b9-bb2b-30733779bead","resolution":{"observed_at":"2026-08-16T11:50:27.837478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08118","last_updated":"2023-10-12T08:22:37Z","snapshot_observed_at":"2026-08-16T16:30:32.076569Z","submitted_at":"2023-10-12T08:22:37Z","title":"Can Large Language Models Really Improve by Self-critiquing Their Own Plans?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08118","snapshot_observed_at":"2026-08-16T11:50:27.842026Z","title":"Can large lan- guage models really improve by self-critiquing their own plans?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.842026Z"},"links":{"cited_paper":"/paper/2310.08118","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:84f5b4590030c5029e979b23968759a4dafa322f636b07390f298ae3575546de","observation_id":"5e1110ee-275e-4c93-8f5c-966c12c56193","resolution":{"observed_at":"2026-08-16T11:50:27.842026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.846740Z","title":"Large language models lack essential metacognition for reliable medical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.846740Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9f412e128f27df965e1f09d30776c5c339d834c10cdeb238837a42ebe54f6e4f","observation_id":"49e02cfd-ec9c-4204-917e-a3e98acae603","resolution":{"observed_at":"2026-08-16T11:50:27.846740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-16T11:50:27.851212Z","title":"Large language models cannot self-correct reasoning yet,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.851212Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d6c25759c8e31182ffe0ffd94fb779990b0d6e9bc95e3093ae6a3d30fa81a96e","observation_id":"42b023a8-cbf4-4719-901a-76c742b31881","resolution":{"observed_at":"2026-08-16T11:50:27.851212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11106","last_updated":"2024-05-17T22:10:23Z","snapshot_observed_at":"2026-08-16T13:51:45.126501Z","submitted_at":"2024-05-17T22:10:23Z","title":"LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11106","snapshot_observed_at":"2026-08-16T11:50:27.855907Z","title":"Llm-based multi-agent rein- forcement learning: Current and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.855907Z"},"links":{"cited_paper":"/paper/2405.11106","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:40f6c00229d7c7af54af32ce295d4f23842961302bf2728cd4eb98084418d22a","observation_id":"1be6a8c3-4756-4598-ad56-93b346f8fc36","resolution":{"observed_at":"2026-08-16T11:50:27.855907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02170","last_updated":"2024-11-15T04:30:04Z","snapshot_observed_at":"2026-08-07T04:49:42.215176Z","submitted_at":"2023-10-03T16:05:48Z","title":"A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02170","snapshot_observed_at":"2026-08-16T11:50:27.860924Z","title":"Dynamic llm-agent network: An llm-agent collaboration framework with agent team opti- mization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.860924Z"},"links":{"cited_paper":"/paper/2310.02170","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:43e0d73815fd90e745129cce1b79d61d74f4a21fa76574c09faeda9a40f018d3","observation_id":"e3a1c42c-2c14-46da-a5a2-310886184be1","resolution":{"observed_at":"2026-08-16T11:50:27.860924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.865663Z","title":"Leveraging large language models for optimised coordination in textual multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.865663Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2b0ea6739d290c9b35a8ae91a13d8daf126438a5d084ab89e76a601d56202352","observation_id":"698330db-ad30-4eb7-8bbd-fab455087f69","resolution":{"observed_at":"2026-08-16T11:50:27.865663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-08-12T16:02:21.969968Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00352","snapshot_observed_at":"2026-08-16T11:50:27.870208Z","title":"Metagpt: Meta programming for multi-agent collaborative framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.870208Z"},"links":{"cited_paper":"/paper/2308.00352","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:fde5c960c28b80f4398f91a2114ed1dca3a41a0de37a2201b00935f95bc47394","observation_id":"364cf4fc-5cf4-4a74-8ac4-69dfc1e583aa","resolution":{"observed_at":"2026-08-16T11:50:27.870208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02485","last_updated":"2024-02-17T05:27:56Z","snapshot_observed_at":"2026-08-16T15:18:28.133558Z","submitted_at":"2023-07-05T17:59:27Z","title":"Building Cooperative Embodied Agents Modularly with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02485","snapshot_observed_at":"2026-08-16T11:50:27.874878Z","title":"Building cooperative embodied agents modularly with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.874878Z"},"links":{"cited_paper":"/paper/2307.02485","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b90faad4b06e8283aed569b9d5962e84e9503297dd228b2d9d04cd853981a076","observation_id":"8777bdbe-28ec-468b-8ee2-64ba41735139","resolution":{"observed_at":"2026-08-16T11:50:27.874878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.879546Z","title":"Smart-llm: Smart multi-agent robot task planning using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.879546Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:c36bd01956128d62cf8b76feb12bb4aff97a15f689e81f5a59d6f90514922ece","observation_id":"1ee36bf9-6b7b-4bdc-bdfe-5c28d25f82b1","resolution":{"observed_at":"2026-08-16T11:50:27.879546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.883728Z","title":"Roco: Dialectic multi-robot col- laboration with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.883728Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:fcadde6dbb3764fe9c41372b19c7d33a83254f760aebc1cfdb69f4fa8ff0d306","observation_id":"1e6c3d32-4502-4e7e-bd49-c845961de962","resolution":{"observed_at":"2026-08-16T11:50:27.883728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07937","last_updated":"2025-05-06T14:06:58Z","snapshot_observed_at":"2026-08-16T14:52:52.889738Z","submitted_at":"2023-10-11T23:17:43Z","title":"Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07937","snapshot_observed_at":"2026-08-16T11:50:27.888658Z","title":"Co-navgpt: Multi-robot cooperative vi- sual semantic navigation using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.888658Z"},"links":{"cited_paper":"/paper/2310.07937","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:1d69f2a8c9b6082ccb44c2118139402fee8a4905d1030da84604a6dc99d96765","observation_id":"ffa46914-3744-4eb5-9038-cdd6a3550848","resolution":{"observed_at":"2026-08-16T11:50:27.888658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12482","last_updated":"2024-05-23T06:29:00Z","snapshot_observed_at":"2026-08-16T14:08:31.429522Z","submitted_at":"2024-03-19T06:39:47Z","title":"Embodied LLM Agents Learn to Cooperate in Organized Teams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12482","snapshot_observed_at":"2026-08-16T11:50:27.893387Z","title":"Embodied llm agents learn to cooperate in organized teams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.893387Z"},"links":{"cited_paper":"/paper/2403.12482","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:322afc755cdbd33b2c76ec8a49335f176d433af6ba1ee8af7476bf08f9740e80","observation_id":"45e3ee58-f44c-4e3f-887b-0270a1e01346","resolution":{"observed_at":"2026-08-16T11:50:27.893387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20151","last_updated":"2025-01-21T06:26:43Z","snapshot_observed_at":"2026-08-16T14:47:23.492551Z","submitted_at":"2023-10-31T03:37:11Z","title":"Multi-Agent Consensus Seeking via Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20151","snapshot_observed_at":"2026-08-16T11:50:27.898289Z","title":"Multi-agent consensus seeking via large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.898289Z"},"links":{"cited_paper":"/paper/2310.20151","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:fd4f3064efd2f89d3e340567c94de6a2fe00d7a1b882706f084fa805f24ce9df","observation_id":"43151392-5bfa-46e7-8c12-d548975aae4d","resolution":{"observed_at":"2026-08-16T11:50:27.898289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03185","last_updated":"2025-04-04T05:26:28Z","snapshot_observed_at":"2026-08-16T12:44:03.628744Z","submitted_at":"2025-04-04T05:26:28Z","title":"Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents","version":1},"cited_work":{"arxiv_id":"2504.03185","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03185","snapshot_observed_at":"2026-08-16T11:50:29.180480Z","title":"Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents","venue":"cs.CL","work_id":"e3bd065d-7cf9-4c22-8956-2078257d9277","year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.903048Z"},"links":{"cited_paper":"/paper/2504.03185","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b1c7ed9d8275ad62a92d99de735e9357ec4170ed695bcc5180b1f342f609ebe6","observation_id":"ebe41552-9243-42fa-bf8e-cd80ba91705b","resolution":{"observed_at":"2026-08-16T11:50:29.185967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-16T12:50:41.441285Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-16T11:50:27.907723Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.907723Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:fb945712715ffff8adfd1a1c9b320688d65bb57bafa90ca832b19b5acd7bc904","observation_id":"352db76e-7349-40df-9c3b-bbb078ccf2b1","resolution":{"observed_at":"2026-08-16T11:50:27.907723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10701","last_updated":"2024-06-26T20:15:34Z","snapshot_observed_at":"2026-08-16T14:51:52.760033Z","submitted_at":"2023-10-16T07:51:19Z","title":"Theory of Mind for Multi-Agent Collaboration via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10701","snapshot_observed_at":"2026-08-16T11:50:27.912446Z","title":"Theory of mind for multi-agent collaboration via large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.912446Z"},"links":{"cited_paper":"/paper/2310.10701","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9ea2a0b8558ba050f63615a89fa3f6e151d63508a078f95da543e36760c7fb63","observation_id":"e8b33906-5f13-4b0c-acb1-ef29da2f2776","resolution":{"observed_at":"2026-08-16T11:50:27.912446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.917164Z","title":"Buffer of thoughts: Thought-augmented reasoning with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.917164Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:a18e1b8d1c3e5aeca506ab368f080deff9965e0b4d66c410efd8c2ada929a388","observation_id":"dd710fb3-b6b7-4f08-a328-aa2b344bf477","resolution":{"observed_at":"2026-08-16T11:50:27.917164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01500","last_updated":"2022-07-02T22:37:22Z","snapshot_observed_at":"2026-08-16T17:02:54.753867Z","submitted_at":"2022-05-03T13:58:38Z","title":"Meta Learning for Natural Language Processing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01500","snapshot_observed_at":"2026-08-16T11:50:27.921574Z","title":"Meta learning for natural language processing: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.921574Z"},"links":{"cited_paper":"/paper/2205.01500","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b3d64627e3b1fd30685cca611f0710d1e885cef28b6e12e7f09f61d5a36df1ee","observation_id":"f5bf7050-ed37-4906-9f77-cf7cb5e6d5a3","resolution":{"observed_at":"2026-08-16T11:50:27.921574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-16T14:22:09.896307Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-16T11:50:27.926559Z","title":"Con- tinual learning for large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.926559Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:fd5f7f6dff1f260acf2d68073f17d040bbd6f5d1f4f0dc010feb74faa99ca09f","observation_id":"7c7d0086-2289-4c4b-ab98-b24412aa91f7","resolution":{"observed_at":"2026-08-16T11:50:27.926559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16789","last_updated":"2024-11-25T05:27:13Z","snapshot_observed_at":"2026-08-16T13:57:48.048440Z","submitted_at":"2024-04-25T17:38:57Z","title":"Continual Learning of Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16789","snapshot_observed_at":"2026-08-16T11:50:27.931335Z","title":"Continual learning of large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.931335Z"},"links":{"cited_paper":"/paper/2404.16789","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:dd55971ac21f622dd811c8e78ca2ae6f3fd89ac3595c6881830cdf527e1e77f0","observation_id":"889eb9f5-b774-44aa-be5a-eee1a1c129a3","resolution":{"observed_at":"2026-08-16T11:50:27.931335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18311","last_updated":"2025-09-02T13:28:42Z","snapshot_observed_at":"2026-08-16T13:57:09.061731Z","submitted_at":"2024-04-28T20:44:53Z","title":"Towards Incremental Learning in Large Language Models: A Critical Review","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18311","snapshot_observed_at":"2026-08-16T11:50:27.936058Z","title":"Towards incremental learning in large language models: A critical review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.936058Z"},"links":{"cited_paper":"/paper/2404.18311","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:10aa60193b3527dd6ee27ccb3cea3ba71b8f30490deddaceaffffe87e0822642","observation_id":"529f355d-e1ec-410b-8770-7601458b3a14","resolution":{"observed_at":"2026-08-16T11:50:27.936058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08184","last_updated":"2025-02-08T04:18:16Z","snapshot_observed_at":"2026-08-16T14:52:46.316832Z","submitted_at":"2023-10-12T10:20:36Z","title":"Learning from models beyond fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08184","snapshot_observed_at":"2026-08-16T11:50:27.940822Z","title":"Learn from model beyond fine-tuning: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.940822Z"},"links":{"cited_paper":"/paper/2310.08184","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:67d85b513a76ec3b99a95dd71cf2387888976efb6fb28fbcbdabcce1bb3bc747","observation_id":"97d70b5f-788b-4f6f-af2d-ea48749a2aee","resolution":{"observed_at":"2026-08-16T11:50:27.940822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11698","last_updated":"2024-06-17T16:14:11Z","snapshot_observed_at":"2026-08-16T13:42:11.229693Z","submitted_at":"2024-06-17T16:14:11Z","title":"Meta Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11698","snapshot_observed_at":"2026-08-16T11:50:27.945469Z","title":"Meta rea- soning for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.945469Z"},"links":{"cited_paper":"/paper/2406.11698","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9f520a73c45c97295822688c8aa07dc30db87f6f49912f38aac0d4d11ee15c80","observation_id":"5dc7f790-083b-4d13-a459-46dc0a0c4f84","resolution":{"observed_at":"2026-08-16T11:50:27.945469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.950019Z","title":"Reasoning with large language models, a survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.950019Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:c3842516558ae1684da0f15a164f7ccdfabeb3b3f60a762f8dde88477c125441","observation_id":"68c5b9f5-1cba-499a-b9c0-edb8a2a9bacf","resolution":{"observed_at":"2026-08-16T11:50:27.950019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.954474Z","title":"Gizaml: A collaborative meta-learning based framework using llm for automated time-series forecasting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.954474Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:92e19b476332e2c8be31a4bba7c80034428eb60b33823fea5c7c1e7baa8c9e59","observation_id":"8ef3dec7-8bee-4817-900b-2b2c8f74c115","resolution":{"observed_at":"2026-08-16T11:50:27.954474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.959408Z","title":"Towards lifelong learning of large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.959408Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:859c091373e5a0a2bf455104e67efb627cecc957009c1c62cdd3e16732139594","observation_id":"034a4aa5-03f0-460b-9991-e56b5462e6f8","resolution":{"observed_at":"2026-08-16T11:50:27.959408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-16T12:50:14.908183Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-16T11:50:27.964075Z","title":"Thinking ma- chines: A survey of llm based reasoning strategies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.964075Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:bcd3b087184a4e7cce0917e94229b6ddcaa3371e4383e90b5f3796aa7af89ef8","observation_id":"35511f4b-50f6-4ed2-b0f4-fea4370ae594","resolution":{"observed_at":"2026-08-16T11:50:27.964075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13975","last_updated":"2024-12-20T12:52:00Z","snapshot_observed_at":"2026-08-16T13:41:15.349130Z","submitted_at":"2024-06-20T03:50:23Z","title":"MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13975","snapshot_observed_at":"2026-08-16T11:50:27.968815Z","title":"Mr-ben: A meta-reasoning benchmark for evaluating system-2 thinking in llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.968815Z"},"links":{"cited_paper":"/paper/2406.13975","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:6b45ee717609a295055796c93c0e18f15fd9b8460928286faeb4eecd2b1dc0e3","observation_id":"7cb7659b-e411-4e9a-a034-897ef2f3b2a9","resolution":{"observed_at":"2026-08-16T11:50:27.968815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17169","last_updated":"2024-10-07T03:48:18Z","snapshot_observed_at":"2026-08-16T13:39:56.946061Z","submitted_at":"2024-06-24T23:02:56Z","title":"Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17169","snapshot_observed_at":"2026-08-16T11:50:27.973380Z","title":"Multi-logieval: Towards evaluating multi- step logical reasoning ability of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.973380Z"},"links":{"cited_paper":"/paper/2406.17169","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:bcbc1a36adc539d85287093d2e849c15ab91dd7f7fb89f6bc7bec66d6d7acd4b","observation_id":"46850007-b9cd-4d20-b553-92a5208124ac","resolution":{"observed_at":"2026-08-16T11:50:27.973380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10338","last_updated":"2025-02-14T17:55:43Z","snapshot_observed_at":"2026-08-10T11:45:52.586654Z","submitted_at":"2025-02-14T17:55:43Z","title":"Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering","version":1},"cited_work":{"arxiv_id":"2502.10338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10338","snapshot_observed_at":"2026-08-16T11:50:28.931547Z","title":"Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering","venue":"cs.CL","work_id":"7244d931-fd1f-4be3-b482-e0461710b9f2","year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.977789Z"},"links":{"cited_paper":"/paper/2502.10338","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2757df701dfeadb8fcd51717776b9301d8adad1b6fba3f34c851785cdb51bb9d","observation_id":"ebcbbd79-9a65-47e0-9a1f-9bff521d5042","resolution":{"observed_at":"2026-08-16T11:50:28.936737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.982603Z","title":"Malalgoqa: Pedagogical evaluation of counterfactual reasoning in large language models and implications for ai in education,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.982603Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b70832a72999d97fb3eacf76e18fda25f4acc353d8f6d03c24fa892d9e8f4a1a","observation_id":"431dabcf-b987-43c7-a8e3-e51b2555374d","resolution":{"observed_at":"2026-08-16T11:50:27.982603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01667","last_updated":"2024-04-02T06:14:54Z","snapshot_observed_at":"2026-08-16T14:04:25.823995Z","submitted_at":"2024-04-02T06:14:54Z","title":"METAL: Towards Multilingual Meta-Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01667","snapshot_observed_at":"2026-08-16T11:50:27.987474Z","title":"Metal: To- wards multilingual meta-evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.987474Z"},"links":{"cited_paper":"/paper/2404.01667","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d1c1a2e1e1a65dbddcdfaad3b00aa5ac7fbf6397101b85b3fda4405cab485744","observation_id":"377461d5-1bdc-4e12-9799-a738d93b855c","resolution":{"observed_at":"2026-08-16T11:50:27.987474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15943","last_updated":"2022-05-03T10:36:39Z","snapshot_observed_at":"2026-08-16T17:45:21.510670Z","submitted_at":"2021-10-29T17:42:08Z","title":"MetaICL: Learning to Learn In Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15943","snapshot_observed_at":"2026-08-16T11:50:27.992183Z","title":"Metaicl: Learn- ing to learn in context,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.992183Z"},"links":{"cited_paper":"/paper/2110.15943","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0e38ecf594f250b9fed305d135a2d17bfa9c58bb362dd7c53112c762f4aa02c9","observation_id":"bd47ff9c-9ebf-4db1-a278-a2dc24002790","resolution":{"observed_at":"2026-08-16T11:50:27.992183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:27.997065Z","title":"Towards metacognitive clinical reasoning: Benchmarking md-pie against state-of-the-art llms in medical decision-making,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:27.997065Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d75b67b83516ab7e15ea2b500d9a021a2bbb47d271d67e15bb2641130e7ce9db","observation_id":"4e4b7159-712f-4537-ba66-a7ee4299d250","resolution":{"observed_at":"2026-08-16T11:50:27.997065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18153","last_updated":"2023-05-30T15:14:06Z","snapshot_observed_at":"2026-08-16T15:28:38.296755Z","submitted_at":"2023-05-29T15:30:13Z","title":"Do Large Language Models Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18153","snapshot_observed_at":"2026-08-16T11:50:28.001877Z","title":"Do large language models know what they don’t know?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.001877Z"},"links":{"cited_paper":"/paper/2305.18153","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:6e458091d7e250855fafe0e38a9182cb2919a6dd53a88a0636827640c32d6f44","observation_id":"dc0c558f-ff7e-4608-b522-ec34abe6f280","resolution":{"observed_at":"2026-08-16T11:50:28.001877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.006674Z","title":"Language grounded multi- agent reinforcement learning with human-interpretable communica- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.006674Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:f8a38eea32724d902ecb96d9ec547dfbfaffc812ffb3a6749d4722a8fea7ed2a","observation_id":"d9ae61b9-778e-49eb-9f06-cb89bc74c7c0","resolution":{"observed_at":"2026-08-16T11:50:28.006674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07086","last_updated":"2024-12-12T01:41:28Z","snapshot_observed_at":"2026-08-16T13:35:40.913304Z","submitted_at":"2024-07-09T17:57:15Z","title":"Hypothetical Minds: Scaffolding Theory of Mind for Multi-Agent Tasks with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07086","snapshot_observed_at":"2026-08-16T11:50:28.011118Z","title":"Hypo- thetical minds: Scaffolding theory of mind for multi-agent tasks with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.011118Z"},"links":{"cited_paper":"/paper/2407.07086","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:577a5880ef1b0913306ec49d10a4a47de1881bc0942403c295847a383af54a8d","observation_id":"67fcd80a-e994-4467-af7e-ddc518990c26","resolution":{"observed_at":"2026-08-16T11:50:28.011118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T11:50:28.015604Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.015604Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:ab9d7e7334ff71ff5c295a927c327736656e4488dcdb0b94aac2a4d63c2df0d4","observation_id":"ebbc836d-4e0a-40dc-aacb-1fc3ce636dcd","resolution":{"observed_at":"2026-08-16T11:50:28.015604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.020070Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.020070Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:a9e934a003805026d11e35ded411eaa90e9ad2d0ca7129121d9bf990ccd8b524","observation_id":"92a9ccc0-e665-4136-b76a-460f8febf5ee","resolution":{"observed_at":"2026-08-16T11:50:28.020070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15673","last_updated":"2024-12-23T06:03:31Z","snapshot_observed_at":"2026-08-16T13:40:35.858225Z","submitted_at":"2024-06-21T22:29:40Z","title":"Large Language Models have Intrinsic Self-Correction Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15673","snapshot_observed_at":"2026-08-16T11:50:28.024588Z","title":"Large language models have intrinsic self-correction ability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.024588Z"},"links":{"cited_paper":"/paper/2406.15673","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:65f8cb00446db00d20a1212208c1aff26a16e829471f0088c516bebd2106c140","observation_id":"e13eeaa1-c6fa-4272-84fa-c432c205caa2","resolution":{"observed_at":"2026-08-16T11:50:28.024588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11790","last_updated":"2022-05-03T19:33:22Z","snapshot_observed_at":"2026-08-16T17:04:44.263631Z","submitted_at":"2022-04-25T17:02:42Z","title":"Can Rationalization Improve Robustness?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11790","snapshot_observed_at":"2026-08-16T11:50:28.029078Z","title":"Can rationalization improve robustness?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.029078Z"},"links":{"cited_paper":"/paper/2204.11790","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0ec919d136ca678ebf081908eaa35a993642fb90738492ebfdd426e40e925acd","observation_id":"8e8ead3d-6cf2-4ef4-9157-ea712b0ae964","resolution":{"observed_at":"2026-08-16T11:50:28.029078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07181","last_updated":"2019-04-06T21:35:43Z","snapshot_observed_at":"2026-08-14T17:14:15.701301Z","submitted_at":"2019-02-19T18:27:12Z","title":"Measuring Compositionality in Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07181","snapshot_observed_at":"2026-08-16T11:50:28.033705Z","title":"Measuring compositionality in representation learning,","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.033705Z"},"links":{"cited_paper":"/paper/1902.07181","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:4f8478b3f2c839a8ef59b0de38919e121a6a9625081cb419fb8c7297a4bbb8f3","observation_id":"41c59bf3-1b97-4413-8d7a-e4df063ee9e4","resolution":{"observed_at":"2026-08-16T11:50:28.033705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03037","last_updated":"2017-02-10T01:48:40Z","snapshot_observed_at":"2026-08-17T00:56:32.664514Z","submitted_at":"2017-02-10T01:48:40Z","title":"Multi-agent Reinforcement Learning in Sequential Social Dilemmas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03037","snapshot_observed_at":"2026-08-16T11:50:28.038753Z","title":"Multi-agent reinforcement learning in sequential social dilemmas,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.038753Z"},"links":{"cited_paper":"/paper/1702.03037","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0cd9fa8b17354b30161c005a118722a1b8aeee1b51b3e012432021f5aa513bba","observation_id":"6affd4e1-55c9-4651-bf20-c75c71cdc5e3","resolution":{"observed_at":"2026-08-16T11:50:28.038753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05449","last_updated":"2024-12-06T22:14:17Z","snapshot_observed_at":"2026-08-15T05:44:12.468039Z","submitted_at":"2024-12-06T22:14:17Z","title":"Towards Effective GenAI Multi-Agent Collaboration: Design and Evaluation for Enterprise Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05449","snapshot_observed_at":"2026-08-16T11:50:28.043495Z","title":"Towards effective genai multi-agent collaboration: Design and evaluation for enterprise applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.043495Z"},"links":{"cited_paper":"/paper/2412.05449","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:3c835fcdd3510e2b4c9cdfce6d89802a993ece6e71350137ecfcc97f46850963","observation_id":"4045999f-60d3-410e-8cd0-9c3db45adbaf","resolution":{"observed_at":"2026-08-16T11:50:28.043495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-08-14T21:47:20.607853Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-16T11:50:28.048060Z","title":"Ai safety via debate,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.048060Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:e1e8790b5f55fea1aa357e23dc3f2af56ecadb50029a53020cf4d8963de2f2b1","observation_id":"27c89c8d-3764-4f1c-aae9-f40bda59ecfa","resolution":{"observed_at":"2026-08-16T11:50:28.048060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.052767Z","title":"Adversarial training for high-stakes reliability,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.052767Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0ae003c0c649e2fb4f4f85c36041f7347997622e1a2ef8cd9e79548c01841300","observation_id":"5941701a-ef45-4456-82a8-9b9cbb91d422","resolution":{"observed_at":"2026-08-16T11:50:28.052767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10095","last_updated":"2023-06-16T16:35:59Z","snapshot_observed_at":"2026-08-16T15:23:17.406238Z","submitted_at":"2023-06-16T16:35:59Z","title":"AD-AutoGPT: An Autonomous GPT for Alzheimer's Disease Infodemiology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10095","snapshot_observed_at":"2026-08-16T11:50:28.057392Z","title":"Ad-autogpt: an autonomous gpt for alzheimer’s disease infodemiology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.057392Z"},"links":{"cited_paper":"/paper/2306.10095","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:1361d609c846a92518d3597b5710ec7b145ddff6d68eb7034ba27cebd20f1515","observation_id":"6612d0f1-855f-48ff-8898-5be4bf4fe428","resolution":{"observed_at":"2026-08-16T11:50:28.057392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.062051Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.062051Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:6822af19604f37a7665e222e5f0c5af11d3a4d143dcacafeff25fb95269a4bed","observation_id":"d9024881-cdfb-4788-91f7-2dbf9b92107c","resolution":{"observed_at":"2026-08-16T11:50:28.062051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.066324Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.066324Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:af3265f5b354fba4902bf65a24b927f4dde40b88f584b4415f5cafff19948faf","observation_id":"2b65ccd2-3f01-410c-a3de-2de81a16e07d","resolution":{"observed_at":"2026-08-16T11:50:28.066324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-16T11:50:28.070616Z","title":"Training language models to self-correct via reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.070616Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:1e4e31c5d7119062516552730035aa20b23f47862a89d804f70717f82e405409","observation_id":"961f0250-0a70-4bf2-b01b-fdfd2a0a40fa","resolution":{"observed_at":"2026-08-16T11:50:28.070616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-16T16:01:25.565982Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-16T11:50:28.075344Z","title":"A survey of meta-reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.075344Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:8a31ba7f49b88a5656ca1c40bd32027d81c1f39266f687b7fc167ff9bb13095a","observation_id":"ce8f0fa8-a1ad-4dbf-8c38-a30ac0bcf42d","resolution":{"observed_at":"2026-08-16T11:50:28.075344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-16T11:50:28.079809Z","title":"Eureka: Human- level reward design via coding large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.079809Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:ff5c2f3e800888fca5932fdef48490ac88d4e496c82ec66b4ecdd77b794fe206","observation_id":"85be3b41-3738-43e8-9fcb-d5c5900d92ad","resolution":{"observed_at":"2026-08-16T11:50:28.079809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-16T11:50:28.084177Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.084177Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:108d106d4c523c1b3cd4399e12ffe115a2395ed5d0327d035f5bd71c59c920ca","observation_id":"7e57c22b-0edb-45fc-b1af-92cf449c920b","resolution":{"observed_at":"2026-08-16T11:50:28.084177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.088784Z","title":"Learning to summarize with human feedback,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.088784Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9f20e94b78a6fb8b0e2a9aae2fc60c5119a08bd73e598c1b8a647ff05cdf408b","observation_id":"93397ad0-a6c0-4119-b5ef-f58d4b6bbc0c","resolution":{"observed_at":"2026-08-16T11:50:28.088784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12563","last_updated":"2024-05-13T11:01:17Z","snapshot_observed_at":"2026-08-16T14:17:09.418577Z","submitted_at":"2024-02-19T21:38:02Z","title":"Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12563","snapshot_observed_at":"2026-08-16T11:50:28.092823Z","title":"Confidence matters: Revisiting intrinsic self-correction capabilities of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.092823Z"},"links":{"cited_paper":"/paper/2402.12563","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:1ab946b8532df536832754695fb527873374c6cbbea28f7c54bd3df06ae91737","observation_id":"0a0131c6-e27b-4d0c-ba80-8fb8cc73294d","resolution":{"observed_at":"2026-08-16T11:50:28.092823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-11T00:07:17.195166Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11463","snapshot_observed_at":"2026-08-16T11:50:28.097413Z","title":"Curiosity- driven reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.097413Z"},"links":{"cited_paper":"/paper/2501.11463","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:4ac4cfa7895e36d994d6c8cc1938155a7dc9fd376ab55110a848fdde1e516858","observation_id":"c1f33125-130b-4524-aa1c-2a2cadc76e4a","resolution":{"observed_at":"2026-08-16T11:50:28.097413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.101951Z","title":"Online intrinsic rewards for decision making agents from large language model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.101951Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:9f5a61c0f374a2a193bec5ab99018b94900bfee528f6120c5532d8b01a1ce37b","observation_id":"4e39e6a5-dffc-4217-b1c4-ae0d3fd4e97a","resolution":{"observed_at":"2026-08-16T11:50:28.101951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T11:50:28.106527Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.106527Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:80e69538b5b82c23d73c2edf47844a3259ef488a87e2488003e764f8cf19d816","observation_id":"45c41508-2731-41d1-9af1-c041ccf42002","resolution":{"observed_at":"2026-08-16T11:50:28.106527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.111357Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.111357Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:a222297adb94d4829b7c0fdebdc12078790f1b2575dbe49a7aef3dcbd58a5463","observation_id":"4290a4a5-6c3b-4d78-b8e2-93a8058b923c","resolution":{"observed_at":"2026-08-16T11:50:28.111357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.115812Z","title":"Human-level play in the game of diplomacy by combining language models with strategic reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.115812Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:4753262ac0e34851e2585e94f2d4502ea9f4842bfb8c572ed13f489bfd95075d","observation_id":"961f9518-3979-41e8-95cb-bd8151638423","resolution":{"observed_at":"2026-08-16T11:50:28.115812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12327","last_updated":"2024-10-27T19:03:37Z","snapshot_observed_at":"2026-08-16T14:17:14.725958Z","submitted_at":"2024-02-19T18:00:53Z","title":"Shall We Team Up: Exploring Spontaneous Cooperation of Competing LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12327","snapshot_observed_at":"2026-08-16T11:50:28.120233Z","title":"Shall we team up: Exploring spontaneous co- operation of competing llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.120233Z"},"links":{"cited_paper":"/paper/2402.12327","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:b1cee490b06d50e13ae1c68f735c708cc15d704e3308746412be6557d3c83df5","observation_id":"77bbbd09-8f67-474a-8f63-6f5ed77d072c","resolution":{"observed_at":"2026-08-16T11:50:28.120233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.124703Z","title":"Self- playing adversarial language game enhances llm reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.124703Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:0e3b1a4e2603c4a221a9c1832dd18e138aa85d39e2951d11f67bf0ba9944d626","observation_id":"d6b594b8-4cf9-4770-9318-2f3ae99696b8","resolution":{"observed_at":"2026-08-16T11:50:28.124703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.129150Z","title":"Logicattack: Adversarial attacks for evaluating logical consistency of natural language inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.129150Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:372b05bfdc80e08afe159402b69ad254062cdab8dfe94d76367a204349d89ef7","observation_id":"b50ec277-b147-423a-8e93-544c3680f91e","resolution":{"observed_at":"2026-08-16T11:50:28.129150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.134129Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.134129Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:6044368b0f0006f4c8e418a47b8307dcc5ef80d2b8cbf5ee058214c272040ccf","observation_id":"4d0e1425-408a-4eee-8266-419855a42db0","resolution":{"observed_at":"2026-08-16T11:50:28.134129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09604","last_updated":"2020-07-19T06:36:41Z","snapshot_observed_at":"2026-07-06T09:39:55.355752Z","submitted_at":"2020-07-19T06:36:41Z","title":"Meta-learning for Few-shot Natural Language Processing: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09604","snapshot_observed_at":"2026-08-16T11:50:28.138491Z","title":"Meta-learning for few-shot natural language processing: A survey,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.138491Z"},"links":{"cited_paper":"/paper/2007.09604","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:dee23380a13e68b042e97472e4509c88f24eb706323e8330727190278307952c","observation_id":"54c4ffe3-a2f7-474c-ba71-1c2918a801bc","resolution":{"observed_at":"2026-08-16T11:50:28.138491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17807","last_updated":"2024-04-27T07:06:39Z","snapshot_observed_at":"2026-08-16T13:57:23.254168Z","submitted_at":"2024-04-27T07:06:39Z","title":"Meta In-Context Learning Makes Large Language Models Better Zero and Few-Shot Relation Extractors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17807","snapshot_observed_at":"2026-08-16T11:50:28.143364Z","title":"Meta in- context learning makes large language models better zero and few-shot relation extractors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.143364Z"},"links":{"cited_paper":"/paper/2404.17807","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:d57c235164499301e0f5b7b036921a7d5cc2b8407fb309fa439bcc546eb7baa6","observation_id":"b4a7406c-bca5-4b9d-b880-910dfc948c4c","resolution":{"observed_at":"2026-08-16T11:50:28.143364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15924","last_updated":"2025-02-21T20:41:37Z","snapshot_observed_at":"2026-08-16T12:56:14.500005Z","submitted_at":"2025-02-21T20:41:37Z","title":"Improving Consistency in Large Language Models through Chain of Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15924","snapshot_observed_at":"2026-08-16T11:50:28.148408Z","title":"Improving consistency in large language models through chain of guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.148408Z"},"links":{"cited_paper":"/paper/2502.15924","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:2bb3c8661986378e0eaed89e0570a21ae6d6537dfaed0147e7eae12a21152ca9","observation_id":"df4e08ac-3fce-4d24-877c-f38553618c9b","resolution":{"observed_at":"2026-08-16T11:50:28.148408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:50:28.153101Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.153101Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:59b7dadaf874f94f6f6c607ba11e46f375e69883fea884980582353e7416ae87","observation_id":"3633bd04-b82f-4a56-8a7a-09f3aeff3b4f","resolution":{"observed_at":"2026-08-16T11:50:28.153101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.158013Z","title":"Red teaming language models for contradictory dialogues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.158013Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:c98be838affaa94d26e3cbe4fa390cf6431d8c790a5f66d58b073f982e3e75e5","observation_id":"f1d73e9d-158b-46df-adae-97258db6d2ae","resolution":{"observed_at":"2026-08-16T11:50:28.158013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-16T11:50:28.162336Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.162336Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:4532911ff3aa7f995c3ec78735d97bbd780a68d924e17ee322c693d27051d20e","observation_id":"104758c2-e148-4106-b2f1-69ceb8b023b1","resolution":{"observed_at":"2026-08-16T11:50:28.162336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:50:28.167260Z","title":"Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.167260Z"},"links":{"citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:11c3a2f9c869228e4aedf67c9eae00c440a2a3273c55bedbbd2f276f672d5785","observation_id":"b0de2eb8-aa5b-43e9-b20b-4346b35a212a","resolution":{"observed_at":"2026-08-16T11:50:28.167260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04472","last_updated":"2024-08-20T12:36:06Z","snapshot_observed_at":"2026-08-16T13:27:40.863393Z","submitted_at":"2024-08-08T14:02:45Z","title":"Can LLMs Beat Humans in Debating? A Dynamic Multi-agent Framework for Competitive Debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04472","snapshot_observed_at":"2026-08-16T11:50:28.171568Z","title":"Can llms beat humans in debating? a dynamic multi-agent framework for competitive debate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:50:28.171568Z"},"links":{"cited_paper":"/paper/2408.04472","citing_paper":"/paper/2504.14520"},"observation_digest":"sha256:f77633ac96738e5146aa1963e342c34a828eea6e602cf9c43bc2c697d6c05381","observation_id":"219f7fc9-5318-4c73-bf61-8388a04b39f8","resolution":{"observed_at":"2026-08-16T11:50:28.171568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T11:44:41.252031Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 4 inbound Pith citation observations for arXiv:2504.14520."}