{"as_of":"2026-08-11T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97aeb758db56bd237f0b0d5474e671f2ea525fcefbb221f993d2d33f4c07dc65","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:25:00.054246Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15306/citation-record","integrity":"/paper/2505.15306/integrity","json":"/paper/2505.15306/citation-record.json","paper":"/paper/2505.15306"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.675215Z","title":"Reinforcement learning: An introduction.A Bradford Book, 2018","venue":null,"work_id":"ead896c9-9773-499a-bcf4-3648c56c5489","year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.234369Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:3101ba46059a307306e01d3be719922046301d44f04227057959bf9225bd4ee2","observation_id":"7ad5cac9-df3a-44a8-bfda-9bd22a7c4f8b","resolution":{"observed_at":"2026-08-07T15:25:01.681461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.652022Z","title":"An introduction to deep reinforcement learning.Foundations and Trends® in Machine Learning, 11(3-4):219–354, 2018","venue":null,"work_id":"66cdb308-6705-49af-9133-68b05c22825f","year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.288962Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:079488df766d7d8eefb469ae2ec263b859c474e3788ba554c89d33a6f62e24d6","observation_id":"b65d7d72-dd7a-4714-becf-e4a3fe7b93d8","resolution":{"observed_at":"2026-08-07T15:25:01.660069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:56.346937Z","title":"Mastering the game of go without human knowledge.nature, 550(7676):354–359, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.346937Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:135e7d055b215c50c255667d87658b83b060f202bea983bcd1cea0db0f0717e9","observation_id":"e379d43f-4d11-4265-8313-801cd0839fad","resolution":{"observed_at":"2026-08-07T15:24:56.346937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:56.431165Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.431165Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:3537a4d4ada7f6a6ae5fe1334ce3b11f5c2f75e724043a633babc47881b8f244","observation_id":"2db00582-0d4f-4bac-856b-d4dcff09eaab","resolution":{"observed_at":"2026-08-07T15:24:56.431165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T15:24:56.541701Z","title":"Dota 2 with large scale deep reinforcement learning.arXiv preprint arXiv:1912.06680, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.541701Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:284c614a4a44b5b14127d38cd1ed04ac71d9ce811fafbf99ada8770eff8af973","observation_id":"b5c85c06-0d0d-4240-a7f2-d61777df09e3","resolution":{"observed_at":"2026-08-07T15:24:56.541701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.599875Z","title":"Mastering atari games with limited data.Advances in neural information processing systems, 34:25476–25488, 2021","venue":null,"work_id":"620f2823-0358-4e46-9374-f14cf3b7ee33","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.598174Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:47a3e23d23cf34bef1a6735651a3521aeb3c6aff83fb299741a95374c4159db8","observation_id":"eb94c72c-b50b-45d6-98d8-4ab6433b0bf5","resolution":{"observed_at":"2026-08-07T15:25:01.606430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.578907Z","title":"A graph placement methodology for fast chip design.Nature, 594(7862):207–212, 2021","venue":null,"work_id":"b07450d4-bc90-4ca1-9ef9-6836f6cdb249","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.693310Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:7cc1f7ec52a4253751db5892b5d4ad3e71d114f4e241c4bd0c8c30cfb6378f6f","observation_id":"78b34cf3-9b9d-4b81-85d1-48c022f7a2b8","resolution":{"observed_at":"2026-08-07T15:25:01.584564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.552233Z","title":"Hierarchical reinforcement learning for scarce medical resource allocation with imperfect information","venue":null,"work_id":"fde13553-a7f4-486e-b0ea-fb83a4ec9c7e","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.767959Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:74338c5998d10b80d2d2d0694ac1e0f2a570729e26d89006949f1c1da9999ac8","observation_id":"d14d986c-aa0b-4a88-a7b6-4179af0f8d06","resolution":{"observed_at":"2026-08-07T15:25:01.558171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.533329Z","title":"Reinforcement learning enhances the experts: Large-scale covid-19 vaccine allocation with multi-factor contact network","venue":null,"work_id":"9ba4270f-8399-4a13-bfbb-c0880a5d0d3b","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.855259Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:ce2855a499661e7cb32ff7fa89aa0485d932ef396a1edece282f2d8724ff4537","observation_id":"99e60500-87cd-4591-81ca-4282dfb822a5","resolution":{"observed_at":"2026-08-07T15:25:01.538975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.515592Z","title":"Gat-mf: Graph attention mean field for very large scale multi-agent reinforcement learning","venue":null,"work_id":"9c4efd01-425d-4e37-abc1-459c6717e799","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:56.945786Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:337eed5ac2566a0c4a0bfbf72548d192b207a242c1ea63b2a43adb76fc625360","observation_id":"f0e78dcd-1a14-4ab8-9db4-436492db1d43","resolution":{"observed_at":"2026-08-07T15:25:01.520522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:57.047385Z","title":"Spatial planning of urban communities via deep reinforcement learning.Nature Computational Science, 3(9):748– 762, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.047385Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:b207112fd2d60819b706c8b03af9060df4850cbc62b8c9a2c464b435be25544b","observation_id":"1638ec47-1810-47be-9ac0-132adbf5f3bb","resolution":{"observed_at":"2026-08-07T15:24:57.047385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.485780Z","title":"A survey of machine learning for urban decision making: Applications in planning, transportation, and healthcare.ACM Computing Surveys, 2024","venue":null,"work_id":"5c1e9bd0-2d12-4cad-b7f4-55fa347eb99f","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.099196Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:0b98084ca0d3c0e94bebabb06dfcc5ece4f872f33fe9f5015ee7f13041cb4691","observation_id":"15e054f8-c016-49d9-a301-117d0711c46d","resolution":{"observed_at":"2026-08-07T15:25:01.491251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.466286Z","title":"Dyps: Dynamic parameter sharing in multi-agent reinforcement learning for spatio-temporal resource allocation","venue":null,"work_id":"a021f86f-327f-4539-ba77-ae9dcf8a65d9","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.212195Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:497078ed17dd74a4f5512183f1205b576c3ec8b7008826d8bfc13ec0eafb1565","observation_id":"39339997-605b-4318-bbbf-bfec067c9de8","resolution":{"observed_at":"2026-08-07T15:25:01.471478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.448349Z","title":"Coopride: Cooperate all grids in city-scale ride-hailing dispatching with multi-agent reinforcement learning","venue":null,"work_id":"8492e5b3-01f0-48a9-9598-7ffa3dca8703","year":2025},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.301068Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:fac1c32bc0066a7be8f4e4d750913fd60fa54bef72232dac3f657ca94786b43c","observation_id":"3652024f-61f0-4ba1-b24b-bf63788475f8","resolution":{"observed_at":"2026-08-07T15:25:01.453447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07165","last_updated":"2025-02-04T05:17:26Z","snapshot_observed_at":"2026-07-06T20:04:25.198952Z","submitted_at":"2024-12-10T03:55:18Z","title":"A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07165","snapshot_observed_at":"2026-08-07T15:24:57.402374Z","title":"A method for evaluating hyperparameter sensitivity in reinforcement learning.arXiv preprint arXiv:2412.07165, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.402374Z"},"links":{"cited_paper":"/paper/2412.07165","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:6fb815e49755f666bf8b40acd893e3e90663d8fc8c17b2f5fc2126f8f22922e5","observation_id":"a86bb074-2a9b-47c2-90ba-95720d7c2bec","resolution":{"observed_at":"2026-08-07T15:24:57.402374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08295","last_updated":"2018-07-05T06:50:33Z","snapshot_observed_at":"2026-07-06T06:46:06.112963Z","submitted_at":"2018-06-21T15:39:19Z","title":"How Many Random Seeds? Statistical Power Analysis in Deep Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08295","snapshot_observed_at":"2026-08-07T15:24:57.516895Z","title":"How many random seeds? statistical power analysis in deep reinforcement learning experiments.arXiv preprint arXiv:1806.08295, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.516895Z"},"links":{"cited_paper":"/paper/1806.08295","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:7dd971e68c7a3d23ba9e33345576908b96bce871120f3514d82f3c3f095bc77e","observation_id":"52045072-bd79-4cbd-a6a1-4dafc2302c9e","resolution":{"observed_at":"2026-08-07T15:24:57.516895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.432221Z","title":"Ensemble deep learning: A review.Engineering Applications of Artificial Intelligence, 115:105151, 2022","venue":null,"work_id":"b03900c1-9ec5-44af-bcb4-36e4dab41bcd","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.614737Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:23cc05224fd8d3dd25e18fad0290da2ee86b76f9a7374e8806acee4104c7f245","observation_id":"73c5c68b-f8d5-41cd-840a-450a3b80d005","resolution":{"observed_at":"2026-08-07T15:25:01.437638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.416070Z","title":"A survey on ensemble learning.Frontiers of Computer Science, 14:241–258, 2020","venue":null,"work_id":"003e4f6d-0420-4122-a16a-0a3d6cefa0ab","year":2020},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.701960Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:3f5fa12a5e9bc15b690ffdb683b0786f3248167c39737b12464b3de1166b5d34","observation_id":"85e2220f-f902-4ad9-a9af-b91f988f89e4","resolution":{"observed_at":"2026-08-07T15:25:01.421082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.400251Z","title":"Ensemble reinforcement learning: A survey.Applied Soft Computing, page 110975, 2023","venue":null,"work_id":"d200903f-a49d-42e2-9564-1c09b254c466","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.775550Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:896b80b410498f0ffa043933e14207988c5144a94607cd07cd535f5485d494b2","observation_id":"422ef0c2-f114-4985-bf1d-8e18ca44d06a","resolution":{"observed_at":"2026-08-07T15:25:01.405209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.384889Z","title":"Neural network ensembles in reinforcement learning","venue":null,"work_id":"c5d1e54a-1ec1-48b7-8376-97bbecfaed81","year":2015},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.856542Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:274b483da6d5aa94f9babec4c1b29b3c053e9d558df854ae1510b9df76cfe817","observation_id":"69160df6-5acd-4af3-b01f-1599a827a21e","resolution":{"observed_at":"2026-08-07T15:25:01.389623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08878","last_updated":"2020-08-20T10:40:42Z","snapshot_observed_at":"2026-08-02T02:40:43.081224Z","submitted_at":"2020-08-20T10:40:42Z","title":"Reinforcement Learning based dynamic weighing of Ensemble Models for Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08878","snapshot_observed_at":"2026-08-07T15:24:57.963590Z","title":"Reinforcement learning based dynamic weighing of ensemble models for time series forecasting.arXiv preprint arXiv:2008.08878, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:57.963590Z"},"links":{"cited_paper":"/paper/2008.08878","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:06443874ab9179f18243f1ff71d3eddbf05a4920aaabac59adc1611ead581123","observation_id":"499cc08f-ef3e-4042-b788-fac959861c37","resolution":{"observed_at":"2026-08-07T15:24:57.963590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.369385Z","title":"Ensemble algorithms in reinforcement learning.IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics), 38(4):930–936, 2008","venue":null,"work_id":"890f2379-d8bf-48f7-9fd8-bf75515a1818","year":2008},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.083139Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:76eb69b7b564980c8ee935d10b6e122dab143c1dace7eac8dd1c6420dace6acc","observation_id":"f5a597ba-0a2c-4a3b-b84f-36281b50f99a","resolution":{"observed_at":"2026-08-07T15:25:01.374081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.353116Z","title":"The arcade learning environment: An evaluation platform for general agents.Journal of Artificial Intelligence Research, 47:253–279, 2013","venue":null,"work_id":"2ad8ea01-72cb-44ed-9e54-8b9bc292557f","year":2013},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.191168Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:c187312d83202a00b379ba74a4aa736bd813f36e766401fcdc34c885f3c1948c","observation_id":"cc9b4d82-1585-4b67-a68d-64dd57681529","resolution":{"observed_at":"2026-08-07T15:25:01.358572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00374","last_updated":"2024-04-03T14:26:32Z","snapshot_observed_at":"2026-08-07T15:39:37.899352Z","submitted_at":"2019-03-01T15:40:19Z","title":"Model-Based Reinforcement Learning for Atari","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00374","snapshot_observed_at":"2026-08-07T15:24:58.285479Z","title":"Model- based reinforcement learning for atari.arXiv preprint arXiv:1903.00374, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.285479Z"},"links":{"cited_paper":"/paper/1903.00374","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a01b335828296355afe236097df1cf2a7bed3a86e746676012d081afae4f272e","observation_id":"9e8f1398-449e-4f9f-a24d-73586e8337f3","resolution":{"observed_at":"2026-08-07T15:24:58.285479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.360163Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.360163Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:479cfa177bb6c1d3cf48da5037abd9341441f5c1d01eff0344d448d14072e689","observation_id":"80b1eed5-579f-40ec-9f56-ebcb17ade291","resolution":{"observed_at":"2026-08-07T15:24:58.360163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.323560Z","title":"A survey of gpt-3 family large language models including chatgpt and gpt-4.Natural Language Processing Journal, page 100048, 2023","venue":null,"work_id":"5f647ae1-3647-4e0b-a697-1fa65f28804d","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.423192Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:f310315c788d3bcbe33e45341760fe2fb70faced553439daa5b9035bc2bf8fac","observation_id":"e4ac7fd4-1ae1-47eb-bc30-7a4d805c4141","resolution":{"observed_at":"2026-08-07T15:25:01.330048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:24:58.507475Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.507475Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a9a4254239f078498dd681dd921e8dc11d4831735e78193cdae823bbb115d79b","observation_id":"2cec5757-1406-40ba-8e63-a0a23a7a4af5","resolution":{"observed_at":"2026-08-07T15:24:58.507475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.596746Z","title":"Evaluation of openai o1: Opportunities and challenges of agi.arXiv preprint arXiv:2409.18486, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.596746Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:823bc19f486ef8764841601478e17b5b5cc20a6e82d96a09d4f1c01aae4dfa20","observation_id":"9ed98770-0f4d-4d91-a149-51d27d2c74ac","resolution":{"observed_at":"2026-08-07T15:24:58.596746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:58.719213Z","title":"Early access for safety testing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.719213Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:fbd9eb991628b6bf09c0048ac0611a17b24f69396f331c423880c59f3a7c3c55","observation_id":"0bd3492f-c5fb-4285-91ba-dc3f233a93e9","resolution":{"observed_at":"2026-08-07T15:24:58.719213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:24:58.773436Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.773436Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:2044e45f6909227730b7eae91323af22afbe56f82656adc1b4b9833e26a4e24e","observation_id":"7e419586-5f54-4b2f-97a6-d767d7a28875","resolution":{"observed_at":"2026-08-07T15:24:58.773436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:24:58.858777Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.858777Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a7dd22952991362d9322d6f42c364718f490e73e34269c1acc140406b9ccb486","observation_id":"81c4a7cd-d620-47d9-aa37-efa2acf441b9","resolution":{"observed_at":"2026-08-07T15:24:58.858777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.288720Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240):1– 113, 2023","venue":null,"work_id":"385ee358-4fdf-407e-9aa0-13f68ccab130","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.905319Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:52b35c70eaf9356742ff47ba5cc06b5359ec6235519cb04b0291e8fe9c732ee3","observation_id":"e50db835-66ed-4bc0-be9d-8dd885ffb078","resolution":{"observed_at":"2026-08-07T15:25:01.296489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09112","last_updated":"2024-10-10T10:46:06Z","snapshot_observed_at":"2026-08-09T18:34:29.323700Z","submitted_at":"2024-10-10T10:46:06Z","title":"HLM-Cite: Hybrid Language Model Workflow for Text-based Scientific Citation Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09112","snapshot_observed_at":"2026-08-07T15:24:58.977041Z","title":"Hlm-cite: Hybrid language model workflow for text-based scientific citation prediction.arXiv preprint arXiv:2410.09112, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:58.977041Z"},"links":{"cited_paper":"/paper/2410.09112","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:231791a9209fcb70415f2afd55a7323bd5a24ca46817ab7f27bc86959bb19b4b","observation_id":"75835048-2848-449e-b468-48470fc8d4d8","resolution":{"observed_at":"2026-08-07T15:24:58.977041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.269075Z","title":"Stance detection with collaborative role-infused llm-based agents","venue":null,"work_id":"5a9ba110-7f2b-45b1-9bfa-08bb5eda9435","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.013226Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:a84ca3da5bca461adc2f4d9ad2137017372600ce44476e874307cf40cba05014","observation_id":"208f9e6d-4ddf-402e-904d-6970c1895359","resolution":{"observed_at":"2026-08-07T15:25:01.274908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T15:24:59.120276Z","title":"A survey of large language models.arXiv preprint arXiv:2303.18223, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.120276Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:44337dff752709d370b497b9fdb4921505961d94afd676c88be7730a997f22cd","observation_id":"9c59abd1-1c3a-417f-917f-fa74e16f8d15","resolution":{"observed_at":"2026-08-07T15:24:59.120276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:59.187554Z","title":"A survey on evaluation of large language models.ACM Transactions on Intelligent Systems and Technology, 15(3):1–45, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.187554Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:f670b49a10825affbdfaf26a429d296d81c45b380a67eafcec95fabedda08d45","observation_id":"2b89717b-1b06-4ca5-a502-4431b39f1141","resolution":{"observed_at":"2026-08-07T15:24:59.187554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T15:24:59.239623Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models.arXiv preprint arXiv:2501.09686, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.239623Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:4eb3036527cad42c50e70fceda647f12f0baf16e40966073893faa5459e03ea6","observation_id":"5e1fc835-6489-454b-9871-983b131ae05f","resolution":{"observed_at":"2026-08-07T15:24:59.239623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:59.336489Z","title":"Human-level control through deep reinforcement learning.Nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.336489Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:ca0b6a9f8e56a9c1c955d1407aff15093661dabfc2c0bcf04cbbbd6289153888","observation_id":"0feaeef7-b1aa-4336-a23b-c0835c105e9f","resolution":{"observed_at":"2026-08-07T15:24:59.336489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.214636Z","title":"Deep reinforcement learning based ensemble model for rumor tracking.Information Systems, 103:101772, 2022","venue":null,"work_id":"e3ddd6d5-eb35-4425-9c60-9e8e9f0d137b","year":2022},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.406512Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:c9a65d81194bf5dcaea1b9050f993fdf16466bff6174d8e847326f76e92053d1","observation_id":"64033e28-5714-48c8-ba06-23aa04f9f757","resolution":{"observed_at":"2026-08-07T15:25:01.226796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.103105Z","title":"An oppositional-cauchy based gsk evolutionary algorithm with a novel deep ensemble reinforcement learning strategy for covid-19 diagnosis.Applied Soft Computing, 111:107675, 2021","venue":null,"work_id":"acb446ba-6d28-42c8-8899-2a1518e256b7","year":2021},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.516768Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:451c724d911b8c8d836a87844eb2d406a8c2aa5ebdc9e4ea3965d6e08337c303","observation_id":"af3c0484-5644-417c-9949-b2722bfb93fe","resolution":{"observed_at":"2026-08-07T15:25:01.179323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00282","last_updated":"2024-10-30T02:22:46Z","snapshot_observed_at":"2026-08-09T21:56:13.004887Z","submitted_at":"2024-03-30T08:28:08Z","title":"Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00282","snapshot_observed_at":"2026-08-07T15:24:59.577571Z","title":"Survey on large language model-enhanced reinforcement learning: Concept, taxonomy, and methods.arXiv preprint arXiv:2404.00282, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.577571Z"},"links":{"cited_paper":"/paper/2404.00282","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:8d3036c1d8d613cf55a0b171bd68a6bcde4a0039e30430b8ef173cc0b5225921","observation_id":"fe683cb7-9a2a-4882-8a66-49e4a15e6b1d","resolution":{"observed_at":"2026-08-07T15:24:59.577571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:01.017497Z","title":"Augmenting autotelic agents with large language models","venue":null,"work_id":"18699445-5e67-4d6f-839e-326b0441f479","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.675486Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:6f91ce9fa4eff4069cd88367a5aa70e16e73a270c38ba0cbd739be7e42d61248","observation_id":"d068ec1c-548d-4d1b-8f5e-9195ddd2e1f5","resolution":{"observed_at":"2026-08-07T15:25:01.080388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.739542Z","title":"Read and reap the rewards: Learning to play atari with the help of instruction manuals.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"1ad73d04-774d-4cd7-836e-4d3439cdf4dc","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.806577Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:b5480932beef6ceebc8a59b385005d9f820b883a256d6fe4b75886e801df0630","observation_id":"5674d13e-b4ba-43fb-b7cc-48b26df7d801","resolution":{"observed_at":"2026-08-07T15:25:00.823614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06687","last_updated":"2023-10-02T17:20:21Z","snapshot_observed_at":"2026-08-03T23:49:55.520138Z","submitted_at":"2023-09-13T02:56:56Z","title":"Self-Refined Large Language Model as Automated Reward Function Designer for Deep Reinforcement Learning in Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06687","snapshot_observed_at":"2026-08-07T15:24:59.961027Z","title":"Self-refined large language model as automated reward function designer for deep reinforcement learning in robotics.arXiv preprint arXiv:2309.06687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:59.961027Z"},"links":{"cited_paper":"/paper/2309.06687","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:3fec1a9f1b251549349dc3c4f41ab5cd9890b521a248a477eb8a3d8a0752ce3c","observation_id":"1bfd96f7-721e-46bc-821e-f6528fd842e8","resolution":{"observed_at":"2026-08-07T15:24:59.961027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.583439Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":"37e6ad0d-2fd9-4932-8fc6-122def7661a0","year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.040054Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:dc78136ee99d0b2fdb1bf4038f11e064d03dbcc15ae1091c5cd2d194acbf09f1","observation_id":"e6e1b00b-aa8c-4a42-a3a7-d870bb862034","resolution":{"observed_at":"2026-08-07T15:25:00.632744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13237","last_updated":"2024-07-18T07:47:51Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T07:47:51Z","title":"LLM-Empowered State Representation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13237","snapshot_observed_at":"2026-08-07T15:25:00.044677Z","title":"Llm-empowered state representation for reinforcement learning.arXiv preprint arXiv:2407.13237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.044677Z"},"links":{"cited_paper":"/paper/2407.13237","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:68e90f14d74e788e5b849d4b2c0bd5ad29434a5cf16d549ce7c6f22fc82face7","observation_id":"61197aeb-f728-4ac8-bfb1-da8bba5d30b2","resolution":{"observed_at":"2026-08-07T15:25:00.044677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T15:25:00.049554Z","title":"Large language model as a policy teacher for training reinforcement learning agents.arXiv preprint arXiv:2311.13373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.049554Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:5d76f94303f9ccc87963d7b58653bdb2093bdf848712c6342dba073c3cd2c9ba","observation_id":"dcc67497-61f2-4cda-bb79-433cc4f087b4","resolution":{"observed_at":"2026-08-07T15:25:00.049554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:25:00.467468Z","title":"Exploration Situation","venue":null,"work_id":"34e87000-0802-4f03-9ea9-42521da3895e","year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.054246Z"},"links":{"citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:1905b640fe702d0db58f6f4bc42809fea0595cd5a10243b66ad35961762dd4c2","observation_id":"b0b4ac66-6707-458b-a5e8-9cec8977cf8d","resolution":{"observed_at":"2026-08-07T15:25:00.520873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T01:40:01.061570Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2505.15306."}