{"as_of":"2026-08-19T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1877cf5c641c73fd6bc5f5429dfd5a8a72220bbebb8c86ec8b9d729665bf62b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:23:08.276030Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:44:27.881977Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T15:26:10.640839Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"cited_work":{"arxiv_id":"2508.12935","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12935","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards open-ended emotional support conversations in llms via reinforcement learning with future-oriented rewards.ArXiv, abs/2508.12935","venue":null,"work_id":"8e5beefd-3a6c-40a4-adca-468e6279072e","year":2025},"citing_paper":{"arxiv_id":"2603.06194","last_updated":"2026-07-29T06:55:29Z","snapshot_observed_at":"2026-08-03T09:13:12.714748Z","submitted_at":"2026-03-06T12:06:57Z","title":"MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T15:25:51.138776Z"},"links":{"cited_paper":"/paper/2508.12935","citing_paper":"/paper/2603.06194"},"observation_digest":"sha256:08375a04c4177815795aeaba4fb048e795d5a3d883952c23c12af75896255c64","observation_id":"4e8f30e5-461e-47af-82a2-6a5025cd2432","resolution":{"observed_at":"2026-05-15T15:26:10.644998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12935","snapshot_observed_at":"2026-08-02T18:44:27.881977Z","title":"Towards open-ended emotional support conversations in llms via reinforcement learning with future-oriented rewards.ArXiv, abs/2508.12935, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06194","last_updated":"2026-07-29T06:55:29Z","snapshot_observed_at":"2026-08-03T09:13:12.714748Z","submitted_at":"2026-03-06T12:06:57Z","title":"MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:44:27.881977Z"},"links":{"cited_paper":"/paper/2508.12935","citing_paper":"/paper/2603.06194"},"observation_digest":"sha256:636da4816625e47932711a47438999769e32d09c7887849ea0df5e3a0682bb07","observation_id":"e9a4f98f-3c66-4700-bf45-9fc25c08dc3b","resolution":{"observed_at":"2026-08-02T18:44:27.881977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12935/citation-record","integrity":"/paper/2508.12935/integrity","json":"/paper/2508.12935/citation-record.json","paper":"/paper/2508.12935"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:23:07.947972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.947972Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:f67885018e613995dc88154e9ef172bcbd47214a6d1722d35fdf7a4bbe7c9150","observation_id":"86142871-be70-42b5-863d-861233250486","resolution":{"observed_at":"2026-08-15T17:23:07.947972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T17:23:07.954920Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.954920Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c2b535b96492900eb0e76719368b6334531b41ad7eca39f6fe86f64b054df897","observation_id":"22133c54-a5ca-4898-8259-ed464fc5fc70","resolution":{"observed_at":"2026-08-15T17:23:07.954920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.535917Z","title":null,"venue":null,"work_id":"5298dc0e-5492-43c1-9528-672b0bc8fbdb","year":2003},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.964223Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:281a9bd48c60801964ef88da1441195c3db07b257185e5a42449449aba661c00","observation_id":"eb9187bb-afa4-4aac-97b4-eb4a020e0984","resolution":{"observed_at":"2026-08-15T17:23:09.547328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.509663Z","title":null,"venue":null,"work_id":"cb8648ad-4ed4-4909-951d-68e67a121e21","year":2013},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.974556Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:5b0406008bdacc8e0b33982879b6cb3c0861d22e3a2562cf5eea6284a7f2683c","observation_id":"6f92f9a6-7bb7-4145-8cef-ef8230d6a9fc","resolution":{"observed_at":"2026-08-15T17:23:09.516545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:07.983124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.983124Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c91651afd4be8bea61d668885975b94199a2d98af94398c6e9957f9d432880e3","observation_id":"799b3054-db43-459c-ba1e-3f497f9a17ac","resolution":{"observed_at":"2026-08-15T17:23:07.983124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:07.989689Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.989689Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:00341b673e4493ab0ed90b43c3ccd87ce9b93441e1d04dd407ca8a89a115894a","observation_id":"b7474df8-fa4d-4cbd-b7e8-d30f47a87f9f","resolution":{"observed_at":"2026-08-15T17:23:07.989689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.474686Z","title":null,"venue":null,"work_id":"4d690bd7-fce1-497c-9bd3-3331fea39111","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:07.996169Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:4b1d46e3809b958ffe00fb58039ed0ceb5f32014941fa985bc619f638aee2a16","observation_id":"7065042c-150b-43ee-a90f-be4e7ae89df7","resolution":{"observed_at":"2026-08-15T17:23:09.481015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.002704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.002704Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:1c96f4cce90c5dfce9b9be84f2fbb2aecf09b3f210f09a448d9d9fb68571285f","observation_id":"4d73e047-4165-43db-815a-10a4259521c9","resolution":{"observed_at":"2026-08-15T17:23:08.002704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.009596Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.009596Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c600d7fe2cb1843381aa4b51ab2b48ce38af54914e2124f1b6dddb506231c88b","observation_id":"77054278-3ed1-4475-acf6-e21c46c2e358","resolution":{"observed_at":"2026-08-15T17:23:08.009596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.447698Z","title":null,"venue":null,"work_id":"e76bef6c-e850-476c-b1b6-2083c3aa178f","year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.018066Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:b1ce1ac664af19dd8e9abf9f54fa6c4123a575a2ed8ae9f16eb92881e2f8d912","observation_id":"69c73f77-ab89-469f-9257-109b98d8329c","resolution":{"observed_at":"2026-08-15T17:23:09.454602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10172","last_updated":"2023-05-17T12:55:52Z","snapshot_observed_at":"2026-08-18T02:21:42.813025Z","submitted_at":"2023-05-17T12:55:52Z","title":"Knowledge-enhanced Mixed-initiative Dialogue System for Emotional Support Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10172","snapshot_observed_at":"2026-08-15T17:23:08.025468Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.025468Z"},"links":{"cited_paper":"/paper/2305.10172","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c6e7888e732ac1c4f78c23b9346629875e1a73e3096dfdb64d82e09d632fa032","observation_id":"4e3de397-e2be-4b3b-930d-230dae3b5518","resolution":{"observed_at":"2026-08-15T17:23:08.025468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10142","last_updated":"2023-05-17T11:55:32Z","snapshot_observed_at":"2026-08-18T17:01:24.684622Z","submitted_at":"2023-05-17T11:55:32Z","title":"Improving Language Model Negotiation with Self-Play and In-Context Learning from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10142","snapshot_observed_at":"2026-08-15T17:23:08.031934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.031934Z"},"links":{"cited_paper":"/paper/2305.10142","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ccc4d4e358e4cae8855b886a187b0d84f447a53491ef8637dd8f4df029c5e821","observation_id":"fb01df84-3482-4719-a149-5e1684d0ec64","resolution":{"observed_at":"2026-08-15T17:23:08.031934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:23:08.036950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.036950Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:8723cbf793b8efcac126ceddce90376267960a2c757c939000f68522a42244d5","observation_id":"f6b9070e-4092-4fbe-ba4d-96e8bac795f7","resolution":{"observed_at":"2026-08-15T17:23:08.036950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T17:23:08.043886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.043886Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:9fb8c87d78a0967d88bd28393064c8e95784f78f6e94ec212be699fbc64e5dd2","observation_id":"8af4dda2-87dc-4eaa-ae11-11d2392c3da6","resolution":{"observed_at":"2026-08-15T17:23:08.043886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:23:08.050016Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.050016Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:8868d783bf43fc975b231cffcc96dba44a5d0b4bec0eb111ea5290bf99547330","observation_id":"ab61585c-c003-48e3-8b30-9ce5c0689137","resolution":{"observed_at":"2026-08-15T17:23:08.050016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.056184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.056184Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:af5e7503c5465ec99927dab1f8f28842a35e72305dc17799e29bd99741461d7e","observation_id":"fc976764-be01-4850-a878-1f1dcd58c13e","resolution":{"observed_at":"2026-08-15T17:23:08.056184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.422671Z","title":null,"venue":null,"work_id":"0ae4edbf-f474-400a-8450-7927d3666909","year":2008},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.062781Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:9a63fe6e4fc31f0e49d467b8d330fa88f0c7970af312008621560b8e1cd1568f","observation_id":"0c039649-772b-4577-ad6a-d68682f169db","resolution":{"observed_at":"2026-08-15T17:23:09.430563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07700","last_updated":"2023-10-11T17:51:28Z","snapshot_observed_at":"2026-08-18T02:21:36.317855Z","submitted_at":"2023-10-11T17:51:28Z","title":"Knowledge-enhanced Memory Model for Emotional Support Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07700","snapshot_observed_at":"2026-08-15T17:23:08.071018Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.071018Z"},"links":{"cited_paper":"/paper/2310.07700","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:29a866299dbe4234a5e1493aee6fff71535a7e82843d46ad3e01c2e70a3c9231","observation_id":"b7a766de-bd57-435d-bcea-2c346f7ce583","resolution":{"observed_at":"2026-08-15T17:23:08.071018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-15T17:23:08.081427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.081427Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:cb7533aeada2517025d6da8414105410cb5eec253eb8b9ef5874d8496323d9a1","observation_id":"72cbd58d-bebe-4ffc-b2fa-deb17b876f24","resolution":{"observed_at":"2026-08-15T17:23:08.081427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.090372Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.090372Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:f7f2ca586e082756ebb1b647fc6fed4806876867124411f2ba10d646617c9331","observation_id":"7367b818-af0c-40c6-a40a-74afbe1468d8","resolution":{"observed_at":"2026-08-15T17:23:08.090372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.097303Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.097303Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:f3bbeaf94d73ec5d4a334925fe5dd756e775122077e0852c31d5fb654d20e3a3","observation_id":"6f2ca1e8-b7f5-4d1e-a4d3-d76284b3bc0b","resolution":{"observed_at":"2026-08-15T17:23:08.097303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:09.395136Z","title":null,"venue":null,"work_id":"f9e9ddf3-78d2-421e-b32e-096b6b0d3ab1","year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.103251Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6b5e996822b66b967b3738766bd4b38f4cfe344c88da3e8288ffe49ae911b5ce","observation_id":"52ceacb1-ceea-4f53-9b07-833cfc9aa726","resolution":{"observed_at":"2026-08-15T17:23:09.403450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12749","last_updated":"2022-11-08T09:00:13Z","snapshot_observed_at":"2026-08-18T02:21:50.045761Z","submitted_at":"2022-04-27T07:43:29Z","title":"Control Globally, Understand Locally: A Global-to-Local Hierarchical Graph Network for Emotional Support Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12749","snapshot_observed_at":"2026-08-15T17:23:08.109938Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.109938Z"},"links":{"cited_paper":"/paper/2204.12749","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6e7a6b93b5c9453abcb8f5dc339c361e4d2a4198dc1839a05643312593f39d2b","observation_id":"4cc495fb-8272-4291-906b-d462379d8bce","resolution":{"observed_at":"2026-08-15T17:23:08.109938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.119974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.119974Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6ae493c3275f357e35eef3cc7d7b2f48c3ae9f54eaa177ce252a9fa01054bc07","observation_id":"a05c2539-e36f-4540-8710-2ef59ed44112","resolution":{"observed_at":"2026-08-15T17:23:08.119974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.130981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.130981Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6b92bcac1311a4b7a7a0584d5f46166ac748e61c4d4f99d80c498ef0c5d6ca25","observation_id":"9c220708-3d9d-47d9-9a84-2c92d32cd5c6","resolution":{"observed_at":"2026-08-15T17:23:08.130981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17795","last_updated":"2025-05-23T12:12:40Z","snapshot_observed_at":"2026-08-17T08:13:09.624280Z","submitted_at":"2025-05-23T12:12:40Z","title":"DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors","version":1},"cited_work":{"arxiv_id":"2505.17795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17795","snapshot_observed_at":"2026-08-15T17:23:09.081877Z","title":"DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors","venue":"cs.CL","work_id":"29f79e70-5716-4df0-b35c-ce159acca521","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.136883Z"},"links":{"cited_paper":"/paper/2505.17795","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:18e74f660ec90555494e648fe3c976866757a0f6d68562ab4f424b187d819640","observation_id":"a78d4596-083c-4051-995f-b23dc2cc464c","resolution":{"observed_at":"2026-08-15T17:23:09.092186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:23:08.145473Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.145473Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:efd5ae7f9c33bb6bf1baf2fa84af072458d3c032395dd29eadd15466919a1702","observation_id":"15b5f6dc-ab3f-4044-a7de-2d282c50d6fb","resolution":{"observed_at":"2026-08-15T17:23:08.145473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:23:08.152078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.152078Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:112ea5ee4ef8b8950725d91ce6261a065d6cbd7980e4859d0731aafb4d33acbf","observation_id":"4661cbb7-9953-4c7a-9c3a-6eea873a13cb","resolution":{"observed_at":"2026-08-15T17:23:08.152078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.159455Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.159455Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c605c284666143fe78d8ebef5fe45d2da5391b4aa8c756a7d53b92972eb3ad75","observation_id":"cb70ae22-fbf6-4d03-b52c-4789fd24c773","resolution":{"observed_at":"2026-08-15T17:23:08.159455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.08782","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.985007Z","title":null,"venue":null,"work_id":"be59559a-693c-49c6-9965-122372d30f95","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.167143Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ffd861d30c525877f292a0d0614edfeeebc78cb13eacf7bdb0cd39bd075c65f8","observation_id":"bdd8397e-9664-45ce-bf94-201cc7a15ba8","resolution":{"observed_at":"2026-08-15T17:23:08.997883Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06987","last_updated":"2025-08-27T08:21:50Z","snapshot_observed_at":"2026-08-19T03:23:08.205432Z","submitted_at":"2025-05-11T14:13:58Z","title":"Convert Language Model into a Value-based Strategic Planner","version":6},"cited_work":{"arxiv_id":"2505.06987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.06987","snapshot_observed_at":"2026-08-15T17:23:08.892937Z","title":"Convert Language Model into a Value-based Strategic Planner","venue":"cs.CL","work_id":"2b544cd1-66b3-4c6e-ad90-e41976d5ce53","year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.174160Z"},"links":{"cited_paper":"/paper/2505.06987","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:da4abcf0fc861d2e95fb0825b65fcbbed4bb3ebdf0fcdb7c7da27b05473a1581","observation_id":"97a58edc-1278-49a9-af8b-0f32bc4bf717","resolution":{"observed_at":"2026-08-15T17:23:08.902534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-15T17:23:08.187202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.187202Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ca1d383d49aab7197f522deee15d24613eb2613804eaa7b16ca4cf8edc192468","observation_id":"cf7d4350-20c7-4229-bbee-5f0d1bb3662f","resolution":{"observed_at":"2026-08-15T17:23:08.187202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-15T17:23:08.194732Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.194732Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:b17154e5ea07b3219a43dd8f551309fc2699cee646fef9977de47e71f39a62f8","observation_id":"1d8e8fcd-67a8-4b44-9e1f-e6d20bf46ac6","resolution":{"observed_at":"2026-08-15T17:23:08.194732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18013","last_updated":"2025-08-15T03:28:39Z","snapshot_observed_at":"2026-08-16T14:14:41.393057Z","submitted_at":"2024-02-28T03:16:44Z","title":"A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18013","snapshot_observed_at":"2026-08-15T17:23:08.202344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.202344Z"},"links":{"cited_paper":"/paper/2402.18013","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:964a5b366cd413599ad871bddc881c41487e210f4a751501efafcf96679ef18a","observation_id":"caf9c035-6335-4b0b-a0fe-0283d8e4c754","resolution":{"observed_at":"2026-08-15T17:23:08.202344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.210664Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.210664Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:72a2eab23577a8b7e6e393f9deeba16af0efef883251caf59fd3297fe361d01e","observation_id":"a3034d0f-6934-4213-b3ec-b482a5ad0973","resolution":{"observed_at":"2026-08-15T17:23:08.210664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.218728Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.218728Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:48886be19e11d320d3b12bc3d7cb7b290d8eeae3b1ec53a418e2fce108aa48f2","observation_id":"db432616-d80b-42ad-a10f-a970d1b668ed","resolution":{"observed_at":"2026-08-15T17:23:08.218728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.228856Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.228856Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:20e76204630e69ea155b77ebe5e47cdb54973498c9b1f62d831f0a2bd2c8c89d","observation_id":"40f65c50-beea-4fb2-99be-3dfd909cc19f","resolution":{"observed_at":"2026-08-15T17:23:08.228856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.234483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.234483Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:111e7b20aa6a61c9f498951b548dd8ad150b73ef339633bd5ce2959e252fadcc","observation_id":"f3b0b9a7-f180-461e-b2e5-7c1c16b0c9b4","resolution":{"observed_at":"2026-08-15T17:23:08.234483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.240307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.240307Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:4b847dc4895e720804aa76b6b1f0f7b4c1f373f6223b3c3b365b4192c2b5dfd1","observation_id":"d158ef72-66d3-490f-8b6b-e8b1fd4206e4","resolution":{"observed_at":"2026-08-15T17:23:08.240307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09582","last_updated":"2023-04-19T11:42:40Z","snapshot_observed_at":"2026-08-17T19:18:22.600615Z","submitted_at":"2023-04-19T11:42:40Z","title":"Is ChatGPT Equipped with Emotional Dialogue Capabilities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09582","snapshot_observed_at":"2026-08-15T17:23:08.246157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.246157Z"},"links":{"cited_paper":"/paper/2304.09582","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:3113c42f7c889541f646c11a6145df4233988fcdbf3b80f09bf5ba48648c5a44","observation_id":"2d35f0ac-6e65-46a6-9452-277cffeea485","resolution":{"observed_at":"2026-08-15T17:23:08.246157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.254565Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.254565Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:ed8621dbcd7600f03c5b92e84c89312a53c424286678172957aeb4d1799f0a3a","observation_id":"057fdc77-3d9f-4243-a36b-6ee5ce92b7ae","resolution":{"observed_at":"2026-08-15T17:23:08.254565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11584","last_updated":"2023-08-17T10:49:18Z","snapshot_observed_at":"2026-08-16T15:07:51.919859Z","submitted_at":"2023-08-17T10:49:18Z","title":"Building Emotional Support Chatbots in the Era of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11584","snapshot_observed_at":"2026-08-15T17:23:08.262052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.262052Z"},"links":{"cited_paper":"/paper/2308.11584","citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:6d5a0e99191164789e6b066ba0d045d2161778cd905c8eea72dfde7730265de6","observation_id":"83ef3e5d-136b-4901-87d2-b402e1e92c46","resolution":{"observed_at":"2026-08-15T17:23:08.262052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.267615Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.267615Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:a61bf77d77f58436f3bba6947bf48b40380b97065c900e422382ea900f1c437f","observation_id":"53ca47ee-4a2c-49e5-a426-528040c49908","resolution":{"observed_at":"2026-08-15T17:23:08.267615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:23:08.276030Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:23:08.276030Z"},"links":{"citing_paper":"/paper/2508.12935"},"observation_digest":"sha256:c121adb7805ae2b6bc89cdfe64e4c8c89caa1d6555239879ce4f450f1830d49f","observation_id":"a715afce-975e-46a6-8be3-788593b3d03a","resolution":{"observed_at":"2026-08-15T17:23:08.276030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12935","last_updated":"2025-08-18T14:04:26Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T23:12:46.591887Z","submitted_at":"2025-08-18T14:04:26Z","title":"Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2508.12935."}