{"as_of":"2026-08-10T05:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28c8c4208820a61dee0bc44b4d3e3ac43bcd6aabc87938723bc326b53b4e6883","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:46:18.444164Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12801/citation-record","integrity":"/paper/2506.12801/integrity","json":"/paper/2506.12801/citation-record.json","paper":"/paper/2506.12801"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T00:46:18.389618Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.389618Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:b57e9b9edd05b6ea3f6843e255abe8cfdd00645c5784c36d5d02c40a139ae832","observation_id":"6d60c76f-c66c-46c7-b466-3e13008fdfaa","resolution":{"observed_at":"2026-08-07T00:46:18.389618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T00:46:18.393519Z","title":"Gong, Shang Guo, Tao Han, Shan Hong, Lifu Hou, Jiamin Hu, Jing Hu, Xia Hu, Kaidong Huang, Yan Huang, Jiaman Li, Ya-Lin Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.393519Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:3b6df2727bbb0660981accc05bc0c55fc086c916ea7d38cb76c5d9900e408828","observation_id":"5e52cbcd-5108-4ad9-a602-db47319b4a2b","resolution":{"observed_at":"2026-08-07T00:46:18.393519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.658152Z","title":"Superhuman ai for heads-up no-limit poker: Libratus beats top professionals","venue":null,"work_id":"6c7884e7-686f-4501-a075-5003c1f7fd60","year":2018},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.397147Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:2d677fed9aba0d12684c3bf23f5b69d31d42b009c979e97f2c49152c24cf2513","observation_id":"d3e3d288-5a06-457b-8a66-40f6bb9cb86c","resolution":{"observed_at":"2026-08-07T00:46:18.663337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.400787Z","title":"Superhuman ai for multiplayer poker","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.400787Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:44558016ddd628fda8b7efb54f3403baf32a2a36ddc9230460d7dc50152161f1","observation_id":"3a463155-2597-4ef2-964b-74a53a875e98","resolution":{"observed_at":"2026-08-07T00:46:18.400787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:46:18.404441Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.404441Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:eeb8375843ff37f975c2646f09612304957b21fd3042f4a2d53ca189c66aaab8","observation_id":"a43e3e5e-e61f-4e27-ac90-a90c677fda84","resolution":{"observed_at":"2026-08-07T00:46:18.404441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13590","last_updated":"2020-04-01T03:46:55Z","snapshot_observed_at":"2026-08-06T09:27:59.802150Z","submitted_at":"2020-03-30T16:18:16Z","title":"Suphx: Mastering Mahjong with Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13590","snapshot_observed_at":"2026-08-07T00:46:18.409319Z","title":"Suphx: Mastering mahjong with deep reinforcement learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.409319Z"},"links":{"cited_paper":"/paper/2003.13590","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:c3dfa6b450ec8d3639bba3f9e3a48e4c2fa4bcb50989ce1753adfb75cba479d8","observation_id":"85fc7ca2-1648-45de-af0e-6a7b1c8fa35a","resolution":{"observed_at":"2026-08-07T00:46:18.409319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:46:18.413161Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.413161Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:929fcb48f8c332315a73af03fc8df2c6f10940d44868d9e815076d99f7ead447","observation_id":"b554b433-b37d-4f9a-9428-7b4829f02ce2","resolution":{"observed_at":"2026-08-07T00:46:18.413161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.632849Z","title":"Hello gpt-4o","venue":null,"work_id":"e78c393c-d62f-4dee-9241-3471fbcd7e22","year":2024},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.417085Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:a6ea10875bcdb113ab804da53138fdf547213511072c6fb07c19fddd97380c8d","observation_id":"594d8a22-23ea-45a4-93fc-9a61eb5e71ca","resolution":{"observed_at":"2026-08-07T00:46:18.640607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13582","last_updated":"2024-02-21T07:26:06Z","snapshot_observed_at":"2026-07-06T17:33:17.224327Z","submitted_at":"2024-02-21T07:26:06Z","title":"Mastering the Game of Guandan with Deep Reinforcement Learning and Behavior Regulating","version":1},"cited_work":{"arxiv_id":"2402.13582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13582","snapshot_observed_at":"2026-08-07T00:46:18.512387Z","title":"Mastering the Game of Guandan with Deep Reinforcement Learning and Behavior Regulating","venue":"cs.AI","work_id":"3f78fa6d-511e-4aa1-b422-e195735ba96b","year":2024},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.420109Z"},"links":{"cited_paper":"/paper/2402.13582","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:4377bde6d3cb866a3bb1d23f1e28c81f16175fa93e7b352df7c0314eab5705db","observation_id":"8a8aaed6-f233-4b68-a2bb-f811d8be521e","resolution":{"observed_at":"2026-08-07T00:46:18.515643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T00:46:18.423124Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.423124Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:64b6424edff9e0a3d96bacf78430fe1ea2e94fa4aca4ab595e84a59b4a55bf15","observation_id":"9d0c5ce8-5151-4d6f-b7e1-8045cc1a05b7","resolution":{"observed_at":"2026-08-07T00:46:18.423124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.617761Z","title":"Trust region policy optimization","venue":null,"work_id":"d6f1cbb1-cf36-4347-9fc3-dbc2e95e5c60","year":2015},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.426144Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:2e63e5a93538a952d96b09faa1f22f592dcd79d871a0a01be3a8b2b6fd908b4f","observation_id":"79dd1ee9-63a7-4d91-bc3e-329bb2afcfba","resolution":{"observed_at":"2026-08-07T00:46:18.623923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.429458Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.429458Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:d271fb87a9b80c29da96ff77a974000fcd53027c41b3dcbc5bce822bcd6a6971","observation_id":"09d1181f-e15e-4e90-95ec-3fbbca9fc126","resolution":{"observed_at":"2026-08-07T00:46:18.429458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:46:18.432777Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.432777Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:17f57a200b2bf06178aa0512b7eeb6dc77086a62425549726f1383490439e7c5","observation_id":"786e676c-117e-4f70-a09f-c81640a7d0c6","resolution":{"observed_at":"2026-08-07T00:46:18.432777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.593309Z","title":"Td-gammon, a self-teaching backgammon program, achieves master-level play","venue":null,"work_id":"2760ed21-f400-4d7d-9bff-c830c2ffdeef","year":1995},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.435553Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:ea76a1851f9544431e2c71158aa270dea61dcc4c3b1361c4b120532a8953bfdc","observation_id":"2cab5b04-4471-45d2-b4a0-5688e6113dbf","resolution":{"observed_at":"2026-08-07T00:46:18.601342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.438225Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.438225Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:17ff01b4b52ae8efec91cc7a4e3bc70f7dbb73819b348e8fd2c9c8cdaf6bdbcb","observation_id":"4dcc26b3-738a-4677-b8d4-a528b7371ddd","resolution":{"observed_at":"2026-08-07T00:46:18.438225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:46:18.571339Z","title":"Tree-of-thought prompting for large language models","venue":null,"work_id":"5390d781-b3b8-4a93-8a68-1fd9f8b0d4fc","year":2023},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.441071Z"},"links":{"citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:ff86bbe5de928ddf83742d2c4ad4de3a00e8f051e3694196cb7119f86762d986","observation_id":"b2e85127-3aad-4059-b998-c8d48157c9be","resolution":{"observed_at":"2026-08-07T00:46:18.577443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06135","last_updated":"2021-06-11T02:45:51Z","snapshot_observed_at":"2026-08-10T04:01:00.333509Z","submitted_at":"2021-06-11T02:45:51Z","title":"DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2106.06135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06135","snapshot_observed_at":"2026-08-07T00:46:18.473206Z","title":"DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning","venue":"cs.AI","work_id":"55cdfb48-7f49-4c75-8bfb-9297b4083eb0","year":2021},"citing_paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:46:18.444164Z"},"links":{"cited_paper":"/paper/2106.06135","citing_paper":"/paper/2506.12801"},"observation_digest":"sha256:ca9b9d05d9bb9cb06dd368e3d9d983619ea030ba77b974b47d79f0664518c5fd","observation_id":"4d98cd54-82a1-42b4-90d4-ae650af919ba","resolution":{"observed_at":"2026-08-07T00:46:18.479386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12801","last_updated":"2025-06-15T10:33:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T00:39:33.864290Z","submitted_at":"2025-06-15T10:33:30Z","title":"Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2506.12801."}