{"as_of":"2026-08-19T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bea52ca3c1a2eab3aa8b7c6e5f9674e127618b522442b04c816fdff8e35ad583","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:52.808169Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24500/citation-record","integrity":"/paper/2505.24500/integrity","json":"/paper/2505.24500/citation-record.json","paper":"/paper/2505.24500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T12:27:48.099504Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.099504Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:b4c6acbc42ef63ad7b35b50e365c301ffc2dc05dae255e9d03b1863ec7384c91","observation_id":"19b10a2d-5766-43e4-baf5-9eeb9d2a81c2","resolution":{"observed_at":"2026-08-07T12:27:48.099504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T12:27:48.257139Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.257139Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:6061fc66d54d7f739b155c8c509e62633b6dff710c12c4abf711b930db2315cd","observation_id":"308dc582-050e-4727-b741-33d9c09ef9e0","resolution":{"observed_at":"2026-08-07T12:27:48.257139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:27:48.555039Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.555039Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:b24271d5895566aaa98a414a758ec6acc7a87fe9780e5054c66d7aa11d238a5b","observation_id":"39d74bd7-4134-4130-aef8-714800e24531","resolution":{"observed_at":"2026-08-07T12:27:48.555039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T12:27:48.797927Z","title":"Progressive tuning: Towards generic sentiment abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.797927Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ff8e71a13f4e998c0052b4fe5304095eadf29706c718aad89674a38165f1cbda","observation_id":"4fb164ae-8e0c-4378-893d-f0e5e985c877","resolution":{"observed_at":"2026-08-07T12:27:48.797927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11886","last_updated":"2024-06-13T13:18:43Z","snapshot_observed_at":"2026-08-18T16:36:40.753235Z","submitted_at":"2024-03-18T15:39:14Z","title":"QueryAgent: A Reliable and Efficient Reasoning Framework with Environmental Feedback-based Self-Correction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11886","snapshot_observed_at":"2026-08-07T12:27:48.938782Z","title":"A notion of complexity for theory of mind via discrete world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.938782Z"},"links":{"cited_paper":"/paper/2403.11886","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:45aeacd8fe86773183566b22e46728c69025da01ac5036e0b971b161afce2308","observation_id":"1093a78b-dfa2-4b22-995a-1f9a9b8871c8","resolution":{"observed_at":"2026-08-07T12:27:48.938782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:27:49.075144Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.075144Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e73cac9def7f8922e41ce4f46ee307b2425ebbac8e792186b3e45d79457d8298","observation_id":"6f3181d8-1738-40d3-9e36-d59e4c93e32f","resolution":{"observed_at":"2026-08-07T12:27:49.075144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T12:27:49.228737Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.228737Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:c05a2f69cf7628f3f68c67d158b8586f91c85f2970856d02b3825f7b91351b93","observation_id":"b7a8e223-9433-4d61-ad96-5bda5d2fa32a","resolution":{"observed_at":"2026-08-07T12:27:49.228737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.577185Z","title":"Perceptions to beliefs: Exploring precursory inferences for theory of mind in large language models","venue":null,"work_id":"804a3341-eede-4f3a-816e-39a595586dfa","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.386878Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:b4c3821bbf462272dbd91375562e7249533d1bcabc342ec5ab922382a5f16333","observation_id":"5d54a5a6-4a1b-4af1-a6cd-1ce9beb6e125","resolution":{"observed_at":"2026-08-07T12:27:55.671442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T12:27:49.679902Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.679902Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4df3bf27a336c9a2b87dfa7e0b4c98aee96e5cd93ef497aeb817977d39ce4eed","observation_id":"86bff7f8-0ddb-470d-8ee2-25c119f40e4e","resolution":{"observed_at":"2026-08-07T12:27:49.679902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12175","last_updated":"2024-12-12T21:29:00Z","snapshot_observed_at":"2026-08-16T12:39:37.628376Z","submitted_at":"2024-12-12T21:29:00Z","title":"Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12175","snapshot_observed_at":"2026-08-07T12:27:49.910942Z","title":"Explore theory of mind: Program-guided adversarial data generation for theory of mind reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.910942Z"},"links":{"cited_paper":"/paper/2412.12175","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:36eaa112bd24c029bdbcfe8e020c066b9b8beb0d348c92f9b003d027668c8218","observation_id":"c307fdb2-94fb-47f7-965b-c555ddcb52af","resolution":{"observed_at":"2026-08-07T12:27:49.910942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:27:50.005114Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.005114Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:04c35300f22549b6ee408bdf7672b6b0e3789a628e209a8b90e08003486294f4","observation_id":"c3fdab7c-ad12-4103-b3fe-b67b516ae7e2","resolution":{"observed_at":"2026-08-07T12:27:50.005114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:27:50.102559Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.102559Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:e3538bb2fdcad1bd644bac1b3efc243265a9d0fc5165925956acbb3467c6a314","observation_id":"7eacdde7-166a-4f7c-9059-def5e592d386","resolution":{"observed_at":"2026-08-07T12:27:50.102559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08838","last_updated":"2025-01-15T14:47:02Z","snapshot_observed_at":"2026-08-16T23:21:32.426146Z","submitted_at":"2025-01-15T14:47:02Z","title":"ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08838","snapshot_observed_at":"2026-08-07T12:27:50.270022Z","title":"Tomato: Verbalizing the mental states of role-playing llms for benchmarking theory of mind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.270022Z"},"links":{"cited_paper":"/paper/2501.08838","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:f58df0a36a079145fa275329efb20425fd076675aa6e35257619b849d54d9501","observation_id":"e809d746-7890-44c6-bfc8-5b44b0404e16","resolution":{"observed_at":"2026-08-07T12:27:50.270022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T12:27:50.567982Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.567982Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:c1ecc76cf13add65d2b2f55ab3c2cf16056c501bc1c1578b09c38e4284a2e379","observation_id":"e5df7549-894f-46fc-8577-1c81973ef424","resolution":{"observed_at":"2026-08-07T12:27:50.567982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:50.713881Z","title":"Climbing the ladder of reasoning: What llms can-and still can’t-solve after sft? arXiv preprint arXiv:2504.11741,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.713881Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:b0ff0d94faccc669a1ae4f4fd5206b7ace1a423090ece7dace35a6d63bb6f3dd","observation_id":"9edca75c-ed6c-4a03-ac76-063551775524","resolution":{"observed_at":"2026-08-07T12:27:50.713881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T12:27:50.908285Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.908285Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:8858aae2119718844aa6250ca365e8796ab043d8366dc888958299e0b37cdb1d","observation_id":"e57198dc-bc3b-4e25-9d4e-e0450c9c8766","resolution":{"observed_at":"2026-08-07T12:27:50.908285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T12:27:51.038674Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.038674Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4c8caba192e4396f19f69a8fd4c324d7376a4ae3b70071af3dffda6a9b51bed4","observation_id":"1b5f4533-fe3b-4e24-8961-ccccea2f8de8","resolution":{"observed_at":"2026-08-07T12:27:51.038674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.030856Z","title":"Hi-tom: A benchmark for evaluating higher-order theory of mind reasoning in large language models","venue":null,"work_id":"e8f6c39a-a548-45e6-8e00-81b39dd1dc7f","year":2023},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.153523Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4afb5204f3072c5277cdc6701cedac20afba270906eb79ede60ffd9c6df0cd95","observation_id":"7474caf0-d8fe-4815-8c1d-71db8aaaefec","resolution":{"observed_at":"2026-08-07T12:27:55.090600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T12:27:51.290313Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.290313Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:808a6e1f30b405e1ee1b500209ae60e2b181dd9beab0ebc41bdbea603b8f9788","observation_id":"2c95a59f-4855-449a-a573-10761728cc9d","resolution":{"observed_at":"2026-08-07T12:27:51.290313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T12:27:51.421057Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.421057Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:da599d77585aa0c68d9f818656605211f97f5fa28a04f9db9baf9169e0f82a31","observation_id":"1634f636-6489-4528-98a5-5373a857391d","resolution":{"observed_at":"2026-08-07T12:27:51.421057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:27:51.563161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.563161Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:f1a43dceb391188728ed744af1976653216605cc42051e0d28d9d895abd3cbcb","observation_id":"28372f1e-66ef-40a4-a453-95af9b8631b5","resolution":{"observed_at":"2026-08-07T12:27:51.563161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T12:27:51.686739Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.686739Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:321cf2a941bcd5f341662ccae2f34b6f6f6f43cae634d5dbb1640a740b4a3bdb","observation_id":"e4451955-6d9b-420b-85b6-d8f8577955af","resolution":{"observed_at":"2026-08-07T12:27:51.686739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00810","last_updated":"2025-04-01T14:01:50Z","snapshot_observed_at":"2026-08-16T12:44:56.257040Z","submitted_at":"2025-04-01T14:01:50Z","title":"Z1: Efficient Test-time Scaling with Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00810","snapshot_observed_at":"2026-08-07T12:27:51.841949Z","title":"Z1: Efficient test-time scaling with code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.841949Z"},"links":{"cited_paper":"/paper/2504.00810","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4703d19ad1789411d709f7337a3a8a14b7182649790b5c822de30a6e4f19f498","observation_id":"1f316624-31ca-4996-a14e-5958a5b4f105","resolution":{"observed_at":"2026-08-07T12:27:51.841949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14135","last_updated":"2024-12-18T18:24:47Z","snapshot_observed_at":"2026-08-16T19:46:44.809444Z","submitted_at":"2024-12-18T18:24:47Z","title":"Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14135","snapshot_observed_at":"2026-08-07T12:27:51.974700Z","title":"Scaling of search and learning: A roadmap to reproduce o1 from reinforcement learning perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:51.974700Z"},"links":{"cited_paper":"/paper/2412.14135","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:64804b1c5f44ab1b58cd89f903fa347e406d36e05d68ad13a0b75fb867438158","observation_id":"585c6ccc-11bf-434b-b600-bd8655e19a10","resolution":{"observed_at":"2026-08-07T12:27:51.974700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:52.105777Z","title":"Autotom: Automated bayesian inverse planning and model discovery for open-ended theory of mind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.105777Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:5074ef680154584524ac05a04f05dbe8d412d61b8fd07be01b9dba02b0837618","observation_id":"f36ab083-ece6-43d4-b9c9-3f3f29937d35","resolution":{"observed_at":"2026-08-07T12:27:52.105777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-18T14:50:54.974621Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-07T12:27:52.254318Z","title":"Sotopia: Interactive evaluation for social intelligence in language agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.254318Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:7d09c585a68a55c5f96e3c680c9b827b661ebd632bc5063dfd80fa352a027b4b","observation_id":"fd96bd9b-3e57-4aa4-80ac-fe5d99d7b201","resolution":{"observed_at":"2026-08-07T12:27:52.254318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-16T12:48:30.366139Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:27:52.419144Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.419144Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:94e1d0bc9abe98e0afce5648baac29d5a2afa878a63e0a7b790ba694ce03c509","observation_id":"4f807b02-017d-4bed-a1be-c32a4eab9262","resolution":{"observed_at":"2026-08-07T12:27:52.419144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.723859Z","title":"The comparison results are shown in Table","venue":null,"work_id":"27c33581-2245-4862-a9bd-12b97fb57b3b","year":2023},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.551126Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:a014b0a0334ab900b1c14eeb938ee21c3b2b696016ceb0b81177ccf66e09094e","observation_id":"fb1d23b2-1d90-41b0-b60f-9e45ef984190","resolution":{"observed_at":"2026-08-07T12:27:54.888072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.323293Z","title":"What LLMs Can—and Still Can’t—Solve after SFT?","venue":null,"work_id":"1df1571f-9ae2-4726-829e-f34323996829","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.696376Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:20d8f0e8ee9000b4a62c599c6916c4995a6b49bb91a14d3b963ff818b23606b9","observation_id":"98b817c3-08ca-43c5-9bba-9f4ad29f3d62","resolution":{"observed_at":"2026-08-07T12:27:54.535643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:54.005201Z","title":"budget forcing","venue":null,"work_id":"f2eabf81-1069-4bc9-b1c8-a1d43dbfbb78","year":2024},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:52.808169Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:f4f397139752c8d1e4c1fb9658b484ae2407bfea044a0e976099e8f3795f6d5a","observation_id":"dd47479f-7f0e-451e-a765-43ba4198eef4","resolution":{"observed_at":"2026-08-07T12:27:54.170166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:27:50.446081Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:50.446081Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:ed94ea0846fda373f78493e05ff0d044381eff66b6576837f120a8fdf206f616","observation_id":"43b977b2-7bc4-4a82-8d8b-6f534d1c1dde","resolution":{"observed_at":"2026-08-07T12:27:50.446081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.382954Z","title":"Revisiting the evaluation of theory of mind through question answering","venue":null,"work_id":"55ba9d00-cede-4912-bb16-7c2d41641513","year":2019},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.528985Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:29460e8c1369aa81b4720c52f7e5c5c4f36b2c00175ad7159f7b674fa448e838","observation_id":"d8dc670e-9460-401a-9bd4-a8a430bd1ccf","resolution":{"observed_at":"2026-08-07T12:27:55.491641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T12:27:48.392575Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.392575Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:01cf875aaed60dc0b7519f2d98d0c5d53302f9e3c451ac41a2124f45adab89bf","observation_id":"c181eec8-6d4f-42e4-a4f9-56e8da5edba2","resolution":{"observed_at":"2026-08-07T12:27:48.392575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:49.594703Z","title":"Relation-r1: Cognitive chain-of-thought guided reinforcement learning for unified relational comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.594703Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:4650317aa5491ebb7d189c6f3effe7daac9ff7534eb9a47dc5ec7860672df137","observation_id":"257d3a63-41ab-44bc-afab-438bd05e1d94","resolution":{"observed_at":"2026-08-07T12:27:49.594703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:55.206937Z","title":"Social iqa: Common- sense reasoning about social interactions","venue":null,"work_id":"3d1e33d1-06fd-41bf-9c19-24348ce38440","year":2019},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.824323Z"},"links":{"citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:577bfe153d9f7914da75b24cd7de3e7a7ff2ed7834820783fcb2cfffde3c3f8a","observation_id":"0f1ef408-6abe-4356-bada-9bfd8f90590e","resolution":{"observed_at":"2026-08-07T12:27:55.299794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-16T22:23:21.433393Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-07T12:27:49.740854Z","title":"11 Zhenting Qi, Mingyuan Ma, Jiahang Xu, Li Lyna Zhang, Fan Yang, and Mao Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:49.740854Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:0c6c0a7bfe2eb8e0d32190e1cb2ef1cc72afc45edad579005c2797ad77de9177","observation_id":"ae8e3374-ad35-4ae9-bc01-3de7c29f3cb3","resolution":{"observed_at":"2026-08-07T12:27:49.740854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T12:27:48.037680Z","title":"Bradley Brown, Jordan Juravsky, Ryan Ehrlich, Ronald Clark, Quoc V Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.037680Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:81d223242b4d1014ecae1c10cb84df8dbf56170030e3e09ff83246948d8d1b85","observation_id":"f67b7fdd-adbd-4450-a8c8-0c4c883b535a","resolution":{"observed_at":"2026-08-07T12:27:48.037680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19898","last_updated":"2025-04-28T15:30:58Z","snapshot_observed_at":"2026-08-17T08:05:28.071014Z","submitted_at":"2025-04-28T15:30:58Z","title":"GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19898","snapshot_observed_at":"2026-08-07T12:27:48.666190Z","title":"Gencls++: Pushing the boundaries of generative classification in llms through comprehensive sft and rl studies across diverse datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:48.666190Z"},"links":{"cited_paper":"/paper/2504.19898","citing_paper":"/paper/2505.24500"},"observation_digest":"sha256:c841eb5d7f28cd2308b7fb82f0f005a6aacf24d71f2b01ecd4e016a958192729","observation_id":"6e6e6052-e199-4952-ad4f-924d4dfd415b","resolution":{"observed_at":"2026-08-07T12:27:48.666190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24500","last_updated":"2025-05-30T12:01:06Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:51:03.191116Z","submitted_at":"2025-05-30T12:01:06Z","title":"TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2505.24500."}