{"as_of":"2026-08-23T20:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:098b6b98532fe34d35cebe0d4350a61c89632ea4432b00db92c603aa8fc5da24","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:02:27.120609Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.17147/citation-record","integrity":"/paper/2507.17147/integrity","json":"/paper/2507.17147/citation-record.json","paper":"/paper/2507.17147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.05438","last_updated":"2021-09-12T06:12:55Z","snapshot_observed_at":"2026-08-18T19:40:22.818552Z","submitted_at":"2021-09-12T06:12:55Z","title":"\"Let Your Characters Tell Their Story\": A Dataset for Character-Centric Narrative Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05438","snapshot_observed_at":"2026-08-06T15:02:26.847892Z","title":"let your characters tell their story","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.847892Z"},"links":{"cited_paper":"/paper/2109.05438","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:dab5140c4475cc6f97932024d820d0a483d2fdec4265548cb4c0e6bad2dd8d9c","observation_id":"4e08cdc8-3d48-4f94-b62b-dc6259fe8d12","resolution":{"observed_at":"2026-08-06T15:02:26.847892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-08-17T02:24:43.845263Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-06T15:02:26.853811Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.853811Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:0d698f68e9eb0da67c726eecaeb8b51868064d1871b0144890b2f03428ec3db8","observation_id":"6baeb213-9b97-482c-b2d0-cea8eb952187","resolution":{"observed_at":"2026-08-06T15:02:26.853811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.859380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.859380Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:2b0d6ad8a0b65a8cac3042436691b70c03330336b306fd7153a87d4c62c97351","observation_id":"8404f121-5560-4e99-bd44-75e8dbaf0d3f","resolution":{"observed_at":"2026-08-06T15:02:26.859380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:28.308904Z","title":null,"venue":null,"work_id":"50bf9a39-8866-4f9f-a60d-46e334a7a42f","year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.864407Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:110eb93226fb0779793fc2bef0eed4b8684c6bd84264c2d052b25e01c5a4c2fb","observation_id":"eee4d1e4-2fc4-4139-bb67-4553658a309a","resolution":{"observed_at":"2026-08-06T15:02:28.315684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-06T15:02:26.869430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.869430Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:52af952f6ce819c4fa07b861166d93c4dbb7657568846c068b2743d296b6c00f","observation_id":"6a359f50-1ac9-471b-9300-3a38ec70366e","resolution":{"observed_at":"2026-08-06T15:02:26.869430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11484","last_updated":"2025-01-10T02:18:01Z","snapshot_observed_at":"2026-08-16T13:33:52.135139Z","submitted_at":"2024-07-16T08:20:39Z","title":"The Oscars of AI Theater: A Survey on Role-Playing with Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11484","snapshot_observed_at":"2026-08-06T15:02:26.874359Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.874359Z"},"links":{"cited_paper":"/paper/2407.11484","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:9a277f6669e40e64aae57a592fc16f41043ec18a0d8eb13c75402eb65b7c9d24","observation_id":"d1ae54d3-fa04-443b-b95c-98e4bde4b0b7","resolution":{"observed_at":"2026-08-06T15:02:26.874359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06869","last_updated":"2023-10-09T05:08:23Z","snapshot_observed_at":"2026-08-18T10:30:45.994385Z","submitted_at":"2022-11-13T10:16:39Z","title":"Large Language Models Meet Harry Potter: A Bilingual Dataset for Aligning Dialogue Agents with Characters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06869","snapshot_observed_at":"2026-08-06T15:02:26.881130Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.881130Z"},"links":{"cited_paper":"/paper/2211.06869","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:b5cc32b5bd4dcdba1d3f7f4420b6c7ffaaa8df6ae6c38e27005a17b5797d650c","observation_id":"de71f6c6-1874-44a7-8913-4a7fa5d75eda","resolution":{"observed_at":"2026-08-06T15:02:26.881130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.886510Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.886510Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:9a05d5b0a10e1c1d2f091094e964a9e7e284cddc7df68ce57153d14dfd9ca741","observation_id":"34fc88e1-6798-46c4-a002-f76722a43669","resolution":{"observed_at":"2026-08-06T15:02:26.886510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:02:26.891631Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.891631Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:7bc7fa1fe08131ae204051df3bd8b993af3b27a6bd879d52313a1d0107ea6a27","observation_id":"8779d4cb-ae39-4f93-ab54-d6954c64d3b0","resolution":{"observed_at":"2026-08-06T15:02:26.891631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-06T15:02:26.897593Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.897593Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:456024e2d520d5deb10922ac0dbc5d4592029a5304ee1c98c286c80ee9b482a1","observation_id":"e2fdbe4c-4f7a-4356-8895-fc782284d778","resolution":{"observed_at":"2026-08-06T15:02:26.897593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16940","last_updated":"2025-07-22T02:01:16Z","snapshot_observed_at":"2026-08-16T12:55:48.911604Z","submitted_at":"2025-02-24T08:08:41Z","title":"Reasoning Does Not Necessarily Improve Role-Playing Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16940","snapshot_observed_at":"2026-08-06T15:02:26.902549Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.902549Z"},"links":{"cited_paper":"/paper/2502.16940","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:ce3436b2a4721380747da4eae9987ca3f9a47b97a0c419750ad9dee6f23ccf9d","observation_id":"27b42656-2331-4b91-97f9-4384be482d25","resolution":{"observed_at":"2026-08-06T15:02:26.902549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.907285Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.907285Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:c1fddf2e29e70122f6c3301dd5de69743214262933ca8dda45850fc06ef6b955","observation_id":"f37ea5c4-dded-4731-a649-4f4bc3453f5f","resolution":{"observed_at":"2026-08-06T15:02:26.907285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.912224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.912224Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:11d6f37338b75add69b4c221d7eafa9edfc8c8b552784a9976fd42b216dd67d7","observation_id":"d83cbc5b-2a6c-4bea-a3f7-91699ac33105","resolution":{"observed_at":"2026-08-06T15:02:26.912224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17662","last_updated":"2025-03-25T14:43:35Z","snapshot_observed_at":"2026-08-16T12:47:46.626628Z","submitted_at":"2025-03-22T06:12:34Z","title":"Enhancing Persona Consistency for LLMs' Role-Playing using Persona-Aware Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17662","snapshot_observed_at":"2026-08-06T15:02:26.917233Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.917233Z"},"links":{"cited_paper":"/paper/2503.17662","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:e2072ee970c9c044740f7e014472d534d7a26527a5d4062cba586e3dcb91e0bd","observation_id":"d03403b8-d6dc-437d-bc49-73343c21339e","resolution":{"observed_at":"2026-08-06T15:02:26.917233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.922458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.922458Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:ab3d651fb2f6e958dff6d6345662c4147ca96e548b53cc82b78da81f351d14c7","observation_id":"257be1cb-b242-431b-9311-391f1800d631","resolution":{"observed_at":"2026-08-06T15:02:26.922458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20840","last_updated":"2025-06-12T05:01:34Z","snapshot_observed_at":"2026-08-16T12:46:38.654476Z","submitted_at":"2025-03-26T13:19:01Z","title":"CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision","version":2},"cited_work":{"arxiv_id":"2503.20840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.20840","snapshot_observed_at":"2026-08-06T15:02:27.839474Z","title":"CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision","venue":"cs.AI","work_id":"d6c52003-225a-41a6-aa40-3680d8892b6f","year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.927340Z"},"links":{"cited_paper":"/paper/2503.20840","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:5c17c28ff3890b989a149b474536565e5392b38157519975fe29ba5c7526ee9a","observation_id":"a658fafb-be38-4542-b42f-8a19164d6021","resolution":{"observed_at":"2026-08-06T15:02:27.845222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-20T14:52:25.331105Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-06T15:02:26.932292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.932292Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:140965d28b534fec8b9fe5c5722d0bb5e946702fe5cfa16f35377f24b5ff87a5","observation_id":"31143d57-8403-4307-9567-3d65736b6bca","resolution":{"observed_at":"2026-08-06T15:02:26.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:26.945889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.945889Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:67372902cc4421fc9675e8f72c28a401b10ee168bcbe75d0f80d78d121efc830","observation_id":"d52518ef-05f8-4ece-af1d-d3a08849b68f","resolution":{"observed_at":"2026-08-06T15:02:26.945889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T15:02:26.951446Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.951446Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:8f847bbf562443cddd617a72926f173a98b98a6e774d4134d81574be5357d52b","observation_id":"8a0aa8bb-b4c2-4c7a-bece-7701bdd1429f","resolution":{"observed_at":"2026-08-06T15:02:26.951446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-08-16T03:49:04.888755Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-06T15:02:26.957432Z","title":"O'Brien, Carrie J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.957432Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:853b48b5a115b3ddf6f825eb2be706ac3142ff3e91a22437701a2f76c11750d3","observation_id":"be5bbd53-e46e-476f-a306-c6903f25c1c8","resolution":{"observed_at":"2026-08-06T15:02:26.957432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-06T15:02:26.964109Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.964109Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:d4bbbe5e650d4f3e7982a3e5dcf820fc776a641dde71c8fcee0d66ed14cc7283","observation_id":"b79f26c2-cf4b-49dd-854a-eea4dfdfb9ab","resolution":{"observed_at":"2026-08-06T15:02:26.964109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06732","last_updated":"2016-05-06T21:18:46Z","snapshot_observed_at":"2026-08-14T22:21:58.983002Z","submitted_at":"2015-11-20T19:25:54Z","title":"Sequence Level Training with Recurrent Neural Networks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06732","snapshot_observed_at":"2026-08-06T15:02:26.969880Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.969880Z"},"links":{"cited_paper":"/paper/1511.06732","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:6cae46fda38ccf3b7319712725c1327a7be280275604980c7b8fd7f2593a0492","observation_id":"e44a1e8b-e94a-4210-a901-687b2bd9ca24","resolution":{"observed_at":"2026-08-06T15:02:26.969880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00207","last_updated":"2019-08-28T21:35:38Z","snapshot_observed_at":"2026-08-19T13:07:14.478846Z","submitted_at":"2018-11-01T03:43:10Z","title":"Towards Empathetic Open-domain Conversation Models: a New Benchmark and Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00207","snapshot_observed_at":"2026-08-06T15:02:26.977002Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.977002Z"},"links":{"cited_paper":"/paper/1811.00207","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:8f95de20a2ab6ecb4229bc7892deef31330ecfd0461d7c3cfb5aee099bbc2c46","observation_id":"3a714bbd-ba6b-41b8-ba6d-ce8cc4df7a99","resolution":{"observed_at":"2026-08-06T15:02:26.977002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01652","last_updated":"2025-01-30T21:04:01Z","snapshot_observed_at":"2026-08-14T05:05:48.239416Z","submitted_at":"2025-01-30T21:04:01Z","title":"Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01652","snapshot_observed_at":"2026-08-06T15:02:26.981947Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.981947Z"},"links":{"cited_paper":"/paper/2502.01652","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:3c2eb2e855c9c037f5f64005a9f3a9c61564ee48e86f2dd4e0f31f78bffdb930","observation_id":"82dad115-11ff-4a67-b5ab-5acc990cc05b","resolution":{"observed_at":"2026-08-06T15:02:26.981947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10158","last_updated":"2023-12-14T11:49:17Z","snapshot_observed_at":"2026-08-19T20:29:37.181570Z","submitted_at":"2023-10-16T07:58:56Z","title":"Character-LLM: A Trainable Agent for Role-Playing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10158","snapshot_observed_at":"2026-08-06T15:02:26.986704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.986704Z"},"links":{"cited_paper":"/paper/2310.10158","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:891cdcb7f570723f29d095df3936e6aec7bbae1b0e0372c2ef429754a6b2020f","observation_id":"16d1ca7c-6a60-4fed-a258-b9511d9a9a83","resolution":{"observed_at":"2026-08-06T15:02:26.986704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:02:26.991162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.991162Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:3698461f0254c530fa74e63bacef4b2438ece1cc31213587c65efa6a8d71e67f","observation_id":"c912c350-cb68-413a-8165-e4826f483f2d","resolution":{"observed_at":"2026-08-06T15:02:26.991162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-17T19:15:32.679249Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-06T15:02:26.997108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.997108Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:8339d119cf48d0f735aea6f029737d7b378eb88e78048c98838b547d90d2359b","observation_id":"f8c35e5a-56a0-4f74-8a97-ca5fc8a3c988","resolution":{"observed_at":"2026-08-06T15:02:26.997108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12591","last_updated":"2025-07-25T09:22:04Z","snapshot_observed_at":"2026-08-17T03:32:19.895448Z","submitted_at":"2024-12-17T06:48:24Z","title":"LLMs are Also Effective Embedding Models: An In-depth Overview","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12591","snapshot_observed_at":"2026-08-06T15:02:27.002338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.002338Z"},"links":{"cited_paper":"/paper/2412.12591","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:fa919bb5ccd0ab717bec260c58c0866b3e2505428ef97ddb6fa395fd0723850d","observation_id":"d9188b5c-73c5-433e-ad33-23f967423673","resolution":{"observed_at":"2026-08-06T15:02:27.002338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:28.230968Z","title":null,"venue":null,"work_id":"72713855-2050-42b5-8fba-923c6ef259e5","year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.007114Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:af2d44c1365a359083a137b94f5de4b175ceeb3dcd378c5a4cbb7fa10b5510a0","observation_id":"780e735e-0711-4724-87e5-ee6ca8b66a2c","resolution":{"observed_at":"2026-08-06T15:02:28.238415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-06T15:02:27.012282Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.012282Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:4422604255d248961059b129cc4aa808b52d34f6d58761d510bb30f84b036172","observation_id":"1b9f1258-f911-435d-bc9d-b463dafdd5a4","resolution":{"observed_at":"2026-08-06T15:02:27.012282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:28.214234Z","title":null,"venue":null,"work_id":"09a4ebaa-5672-43bc-8bb0-512ca3fea136","year":2010},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.018200Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:4b910866b3cfa889d3b2b9c14539f8b40164f62217daa36ee4018fcd7aea754e","observation_id":"074a3ce3-3475-4ce4-aa06-237d8f1ca4fa","resolution":{"observed_at":"2026-08-06T15:02:28.219625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:27.025256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.025256Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:72e82b23df84915564882ec289a4e747c45adda211aa8bf9a266273d6d09068e","observation_id":"77f8b97f-9572-4759-8943-c46baed89086","resolution":{"observed_at":"2026-08-06T15:02:27.025256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:28.191925Z","title":null,"venue":null,"work_id":"5b73775b-8b64-4c95-b0f7-7e91ea7dd618","year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.029872Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:b5dc27d389e8284800877699cd4813adc86e2d36ac78dfc340e34499ead84ca5","observation_id":"ba4f8c21-3cfb-443c-9d7e-eadd3004018c","resolution":{"observed_at":"2026-08-06T15:02:28.197057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:27.034810Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.034810Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:be4674c7c4bbeade812ab809762a8b2a11bba93d695d1d1f21cc1ab9a478484c","observation_id":"37128dca-b97d-4e47-885c-456b1aca554e","resolution":{"observed_at":"2026-08-06T15:02:27.034810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17976","last_updated":"2024-06-07T12:24:53Z","snapshot_observed_at":"2026-08-16T14:48:21.344420Z","submitted_at":"2023-10-27T08:42:18Z","title":"InCharacter: Evaluating Personality Fidelity in Role-Playing Agents through Psychological Interviews","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17976","snapshot_observed_at":"2026-08-06T15:02:27.041691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.041691Z"},"links":{"cited_paper":"/paper/2310.17976","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:f449b4ca5549d18dd694955cb236c57027547931769e6d533224692fdf772990","observation_id":"f8c65467-306b-4c3d-b1ba-4d81bb74ca5a","resolution":{"observed_at":"2026-08-06T15:02:27.041691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-19T12:40:58.780256Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-06T15:02:27.047188Z","title":"Huang, Jie Fu, and Junran Peng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.047188Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:a5801ab5f6794eae4d0baf52519f9b42abe4c215c0d3da5942e13e0b245d313a","observation_id":"9c47933e-6571-489f-9442-701dc090511f","resolution":{"observed_at":"2026-08-06T15:02:27.047188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T15:02:27.052414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.052414Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:ac5cf8daa85cb3bd14bb4b8cebf26334d1ff8b38cb50e7d00b7b4faa24132007","observation_id":"4cc375d0-a90f-443d-914e-9ca25978bceb","resolution":{"observed_at":"2026-08-06T15:02:27.052414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:28.170874Z","title":null,"venue":null,"work_id":"d6dc1759-90fb-4f1d-ba61-c1c8f0a41f40","year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.057998Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:7ab5d8cd8faeb7ce8c4901162737fdad9b62996439b228bc382a6c078e86dae2","observation_id":"45ce1ce7-8878-4f08-8668-00c68c09cf87","resolution":{"observed_at":"2026-08-06T15:02:28.178487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17878","last_updated":"2025-06-03T10:10:00Z","snapshot_observed_at":"2026-08-16T12:55:29.745473Z","submitted_at":"2025-02-25T06:06:16Z","title":"Towards Enhanced Immersion and Agency for LLM-based Interactive Drama","version":2},"cited_work":{"arxiv_id":"2502.17878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17878","snapshot_observed_at":"2026-08-06T15:02:27.350247Z","title":"Towards Enhanced Immersion and Agency for LLM-based Interactive Drama","venue":"cs.CL","work_id":"347cde9d-eba7-43e5-899d-d8a610bcbdd3","year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.064815Z"},"links":{"cited_paper":"/paper/2502.17878","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:330d197328083e0de76db7dda948c492ae868757c2df6462b0ee8d9e2faa26d4","observation_id":"5a833151-3a8c-444a-bd4c-2785aed6747d","resolution":{"observed_at":"2026-08-06T15:02:27.357082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T15:02:27.070162Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.070162Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:2315824c989a5fc7cf14ff60811957d0c2102e1e38d64b1715669a0ccf27bd00","observation_id":"eb81e13e-6023-4429-91fb-db29af084e8a","resolution":{"observed_at":"2026-08-06T15:02:27.070162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08193","last_updated":"2025-03-11T08:57:07Z","snapshot_observed_at":"2026-08-19T15:11:34.404787Z","submitted_at":"2025-03-11T08:57:07Z","title":"Guess What I am Thinking: A Benchmark for Inner Thought Reasoning of Role-Playing Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08193","snapshot_observed_at":"2026-08-06T15:02:27.075822Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.075822Z"},"links":{"cited_paper":"/paper/2503.08193","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:8acb410def654eaeb723e370ff2b8a20844bbf4a7b63890e8c137def0d49a268","observation_id":"13c7b42e-b213-4504-a242-79b5da48fc55","resolution":{"observed_at":"2026-08-06T15:02:27.075822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12138","last_updated":"2024-11-18T11:29:47Z","snapshot_observed_at":"2026-08-16T13:59:46.601207Z","submitted_at":"2024-04-18T12:40:59Z","title":"Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12138","snapshot_observed_at":"2026-08-06T15:02:27.082286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.082286Z"},"links":{"cited_paper":"/paper/2404.12138","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:0138b3d67d83374eb864c64803889bcfe33a51a902e04597614bfdeec0550a76","observation_id":"c0defd52-837d-4df0-bb27-fd32f605d5ff","resolution":{"observed_at":"2026-08-06T15:02:27.082286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T15:02:27.091819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.091819Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:9d0c2090d89f422b805255edcb12f5c93e5263719508cb00ff7d184fdc50840d","observation_id":"df9319ef-3d34-419a-9d45-e224e83e0dbc","resolution":{"observed_at":"2026-08-06T15:02:27.091819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04684","last_updated":"2024-02-02T22:45:05Z","snapshot_observed_at":"2026-08-16T16:17:35.640048Z","submitted_at":"2022-11-09T05:06:12Z","title":"Few-Shot Character Understanding in Movies as an Assessment to Meta-Learning of Theory-of-Mind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04684","snapshot_observed_at":"2026-08-06T15:02:27.097864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.097864Z"},"links":{"cited_paper":"/paper/2211.04684","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:3d119c23109d99f6eb764ec01483b9cda2104060f29debe0178a1d856fce6d0e","observation_id":"6712f72c-af34-4fb2-b409-a4feb87d338e","resolution":{"observed_at":"2026-08-06T15:02:27.097864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12726","last_updated":"2024-10-08T06:54:53Z","snapshot_observed_at":"2026-08-20T01:39:51.429589Z","submitted_at":"2024-04-19T09:10:29Z","title":"Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works","version":3},"cited_work":{"arxiv_id":"2404.12726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12726","snapshot_observed_at":"2026-08-06T15:02:27.219818Z","title":"Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works","venue":"cs.CL","work_id":"766cf31e-49cc-4845-9e0b-23bcb8d78a0a","year":2024},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.103368Z"},"links":{"cited_paper":"/paper/2404.12726","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:a18b47095e5a3e9d3100bfe60ec08254d7157991249a7a06f781fad7b89517e0","observation_id":"e5b23e0c-4134-49fd-acbd-d751861cbbbe","resolution":{"observed_at":"2026-08-06T15:02:27.228027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16832","last_updated":"2023-11-28T14:49:23Z","snapshot_observed_at":"2026-08-20T01:51:25.694111Z","submitted_at":"2023-11-28T14:49:23Z","title":"CharacterGLM: Customizing Chinese Conversational AI Characters with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16832","snapshot_observed_at":"2026-08-06T15:02:27.109104Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.109104Z"},"links":{"cited_paper":"/paper/2311.16832","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:1d9368e175d7322d4d53b4af6c2aa8faf570094fd39eb24575b4deca845c44b5","observation_id":"cd211747-996a-4f65-94cd-623efe742dce","resolution":{"observed_at":"2026-08-06T15:02:27.109104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:27.114741Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.114741Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:2cb47a4817d6fd8b9a6bc673e305ea154783b593f9a641d1f937a78785826d0e","observation_id":"43d9a8bf-47c6-4f54-b457-e72406ae6de8","resolution":{"observed_at":"2026-08-06T15:02:27.114741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:27.120609Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:27.120609Z"},"links":{"citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:c0f20d5260aee3671de4587f0bab72b0755b7eabb606206258a474388d4e40ff","observation_id":"9c3c8003-d20e-40c4-9cd0-5422385fcd77","resolution":{"observed_at":"2026-08-06T15:02:27.120609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T11:44:49.371033Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.17147."}