{"as_of":"2026-08-14T14:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67fd9786ba6498dfa327a95c5abeb427bdc574fe077a2039a1cbe3a81f5d07a0","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:06:27.128981Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06615/citation-record","integrity":"/paper/2507.06615/integrity","json":"/paper/2507.06615/citation-record.json","paper":"/paper/2507.06615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:26.120493Z","title":"Dynamic programming","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.120493Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:1a85c6933497cc1b0db57cde9e54230e8f214164bb86f74a99f6cfd0d298bd89","observation_id":"6956b067-8341-46e0-bcbd-64795b02225e","resolution":{"observed_at":"2026-08-06T19:06:26.120493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T19:06:26.142902Z","title":"OpenAI Gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.142902Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:d2deaf98a477945cc3f56b895b6f202e27e4dd0f639b3a0b660e03677c118886","observation_id":"af101913-8a09-4c41-8e5b-c7de8da6b9f2","resolution":{"observed_at":"2026-08-06T19:06:26.142902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.745673Z","title":"Multitask learning","venue":null,"work_id":"03114718-e864-4a79-9c16-9e6cf203be68","year":1997},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.236390Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:cf8d624080f4375cb6653cd5e0e716e70793583ee3abdbd170053e041c7e5a2b","observation_id":"34431820-cad1-4701-beac-8212532aa7fc","resolution":{"observed_at":"2026-08-06T19:06:27.750463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.729111Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"8dc3341f-73a9-4aae-8e96-dc701fde435e","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.320478Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:9c2891281fe03a78d88029e235890c93afc4dded17db7cd79093acc82796ce23","observation_id":"0c35eeb8-bef0-40c6-9f1b-7770423608ce","resolution":{"observed_at":"2026-08-06T19:06:27.734718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.709816Z","title":"Multi-task reinforcement learning with task representation method","venue":null,"work_id":"89ff0442-89e6-4c5c-95f7-2c15c47cd32c","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.413057Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:a91b5adf602d8615a4b697d27eb9ecf1bdaf5c99e0c7dce2ac2804233f8cb014","observation_id":"d248c66f-4a2b-44e9-91d2-24c7eca148c3","resolution":{"observed_at":"2026-08-06T19:06:27.716411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-06T19:06:26.517932Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.517932Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:e1b50c6cede96615f0f2c5a44a073f8dd14f6b7d0f5d4b8efe079a1a5db634b1","observation_id":"9de1f464-3e53-4755-8767-6d82f0270712","resolution":{"observed_at":"2026-08-06T19:06:26.517932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.691176Z","title":"Divide- and-conquer reinforcement learning","venue":null,"work_id":"28886f51-38b4-422f-b5e7-0a830c49a0de","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.614414Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:1d4a59cc5b3c2fbc5d54b06f21598cf92c47ed6e6ac23aa9d96c56d79dd23d96","observation_id":"ead5de88-ef60-4ba9-b730-12769cb6e820","resolution":{"observed_at":"2026-08-06T19:06:27.696517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.673281Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"8f5fcd9d-9df2-4e54-bd8c-b52eb90d1f4e","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.746446Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:39b16efefb9ddb6e7aaec2dd9934f061c1d2d82908720d48c33e78050a988f02","observation_id":"6ef8dc4f-3342-4c2c-86c4-449f807a9ccb","resolution":{"observed_at":"2026-08-06T19:06:27.678620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.650998Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"89c100da-0cfd-4eec-baa0-8b6fd62ce5c7","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.791807Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:9da0dc62d5b9fe4fbac3ad70482a6053710bc9d198892a0dc7172a7efc41aec3","observation_id":"16bb38e4-780d-4e03-91d3-dec7f354261c","resolution":{"observed_at":"2026-08-06T19:06:27.655915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.635054Z","title":"Not all tasks are equally difficult: Multi-task deep reinforcement learning with dynamic depth routing","venue":null,"work_id":"42a7a28b-8009-42a0-99ad-07a1b3a1cb15","year":2024},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:26.925117Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:997ff168a69d8f9ee53e1956cbc23977b4d98c0ce180cee5a499a9a260d9132d","observation_id":"0ebc75cf-1afd-4094-845d-af7ef6f61713","resolution":{"observed_at":"2026-08-06T19:06:27.640033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.618677Z","title":"Benchmark environments for multitask learning in continuous domains","venue":null,"work_id":"ac904941-2d66-440e-b500-37f252bdf258","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.001434Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:3ae001de1696d85b6f2deb9297cf91af4e2a8513d47b559d581706f951baeca2","observation_id":"4eb6ac94-69b8-4c8a-abea-48aed0d715bf","resolution":{"observed_at":"2026-08-06T19:06:27.623634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.019997Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.019997Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:049250ffeb5f1ce5bd03dde55233511aa60898ed10c118255b8966fd6c2025ab","observation_id":"a8939339-cf84-4fdc-9900-350b4174c8ef","resolution":{"observed_at":"2026-08-06T19:06:27.019997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.584444Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"867234e4-fc98-4bf7-96d4-427c793700d4","year":2016},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.025033Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:d63cff423ee0d74c1ba7c22fbbcb51426562bb5a0b4c1d8d9f651fa7596d68c3","observation_id":"2176921b-bc88-4841-b2a8-0ba171809721","resolution":{"observed_at":"2026-08-06T19:06:27.590920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.568796Z","title":"Conflict-averse gradient descent for multi-task learning","venue":null,"work_id":"a4531eca-add6-4ac6-a4e3-a5eae71fc5b0","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.029335Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:e285eb10d023960c604768c83c40e5fa599d0e54448f96d6780ed8c6ddf26ebd","observation_id":"87174cbe-8b2a-4034-bce1-3a1152b3dbc6","resolution":{"observed_at":"2026-08-06T19:06:27.573810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.548727Z","title":"Q- functionals for value-based continuous control","venue":null,"work_id":"45382fc9-1a5a-406c-8e10-0a9155682ee4","year":2023},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.034309Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:4a2de57b45f9cc907bd904140f7e5d66eefd37af0c2d5f303c05b157eb5ad1a6","observation_id":"2b49c235-0949-4445-82fb-b8b63b001962","resolution":{"observed_at":"2026-08-06T19:06:27.553417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.533106Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"0879044f-369f-4a74-987c-4a536a8fe349","year":2015},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.038650Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:aa83dccf6a5ebda5b9edfb961469fb0466fae46ebf455bc501275c9c281ffd37","observation_id":"1db05804-1920-4860-8fee-fadb7139911b","resolution":{"observed_at":"2026-08-06T19:06:27.537789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.510850Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"342e8556-e511-469d-b68d-267126563da5","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.042996Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:4d1df97dc112072a7488cb3206c482196e862b0567260c385382f6015e97432e","observation_id":"4f258522-cbea-488b-970d-d9e46d6f86fa","resolution":{"observed_at":"2026-08-06T19:06:27.516705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.489554Z","title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","venue":null,"work_id":"6025817d-0813-4a92-80bc-9c47baa9ca0d","year":2014},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.047261Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:19314f2cbcb0055e1a5bbbc11a599696e7886de74f537fb4fb896322d7ba4671","observation_id":"163539aa-9b26-4d44-94bf-750e50195f4e","resolution":{"observed_at":"2026-08-06T19:06:27.494440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-13T21:53:02.384757Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-06T19:06:27.051585Z","title":"An overview of multi-task learning in deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.051585Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:8f8188398f27e03eabf30a780fd027390f986b719b394818fb15bfb590e7965d","observation_id":"2194e526-57fb-41da-a89e-54786c8fc73d","resolution":{"observed_at":"2026-08-06T19:06:27.051585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.473717Z","title":"Hierarchical and interpretable skill acqui- sition in multi-task reinforcement learning","venue":null,"work_id":"e020bbb6-1d70-4a54-bc0d-1036ec5646a1","year":2018},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.056121Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:03aa22dbbacabdbd73cae9af4cea289a0d7bacff9292b5060c1b05929408b005","observation_id":"4bef9725-1cdc-4db8-b924-a907e05a1350","resolution":{"observed_at":"2026-08-06T19:06:27.478520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.457681Z","title":"Multi-task reinforcement learning with context- based representations","venue":null,"work_id":"8d7d4030-0c1f-43ed-9b23-4c7fba4dbdf3","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.060861Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:d4c5482602a6ffde056ae9f5447d0cd24ff84e95f4d43afdc29edad951b06d96","observation_id":"f460c02b-9ff7-401b-b39c-8a451cc4b64f","resolution":{"observed_at":"2026-08-06T19:06:27.462446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.442224Z","title":"PaCo: Parameter- compositional multi-task reinforcement learning","venue":null,"work_id":"76e88749-2f06-4ab1-a4e4-4925486eec2b","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.065190Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:72579e726649108e294a15e3597a4ad94251fe4971606fe039808885f4fcc90b","observation_id":"8f79f070-122f-407e-b8fc-4b0d5f47fbe5","resolution":{"observed_at":"2026-08-06T19:06:27.447306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.427694Z","title":"Czarnecki, John Quan, James Kirkpatrick, Raia Hadsell, Nicolas Heess, and Razvan Pascanu","venue":null,"work_id":"68bcb8d6-d4df-4c1f-8ed3-0f7807e5bffe","year":2017},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.069827Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:b5d64b045a09b8e382f0cb5353c5d5382ca6bfc8491d38eafa0afd0e203eb3ef","observation_id":"2b9f67cb-074c-445a-83ca-e899be6f3b62","resolution":{"observed_at":"2026-08-06T19:06:27.432196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.412455Z","title":"MuJoCo: A physics engine for model-based control","venue":null,"work_id":"ee23e7df-7cba-4812-8b32-9e2676046d51","year":2012},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.074908Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:6ad4a73fef45340c094d7007a87d8e1e2873958b8e0cee6452589287d8c69b8f","observation_id":"158b1812-c2ad-4633-84a0-8b8e28132152","resolution":{"observed_at":"2026-08-06T19:06:27.417318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.394837Z","title":"A survey of multi-task deep reinforcement learning","venue":null,"work_id":"cdf9960d-9432-4318-ae7e-0eebd992f75a","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.080098Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:72e587a7225c96c1f2c0e1d10ddc1c23bd10b95c57900a01dc5cb406cf7f8d13","observation_id":"efcaf77a-b41a-4b39-b64b-899e88b3409e","resolution":{"observed_at":"2026-08-06T19:06:27.399752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.379410Z","title":"Disentan- gling transfer in continual reinforcement learning","venue":null,"work_id":"cb0f4764-b76f-48e4-8586-904303cb0a97","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.085271Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:c9751ceffe3f11b6513db346b85761add9d7d2d18dce223eaeb190cbae470f8e","observation_id":"2f491275-5314-4ac8-ae9a-aca732c37924","resolution":{"observed_at":"2026-08-06T19:06:27.384113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.363136Z","title":"Multi-task reinforcement learning with soft modularization","venue":null,"work_id":"370503dc-35e5-4508-99d5-84287cc04478","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.089372Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:b24aff7a02075761a13b33f89e2ed90e823d0505cec2a48ebe38e1e581227bcd","observation_id":"8f63fe28-5d59-4ced-b086-b51e99ab9290","resolution":{"observed_at":"2026-08-06T19:06:27.367994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.345399Z","title":"Mastering complex control in MOBA games with deep reinforcement learning","venue":null,"work_id":"b99e0394-d0b0-4a01-a019-9d057cf756ae","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.094458Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:8ad0e57fd5e27a1ef8182614fadf704400f944608efa1d4fac9606c6a68b6a39","observation_id":"e64095ba-b40e-49bf-82fa-fdc5b6a898cc","resolution":{"observed_at":"2026-08-06T19:06:27.350804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.329000Z","title":"Conservative data sharing for multi-task offline reinforcement learning","venue":null,"work_id":"0c038f0a-86c5-4f7c-b72b-92c7546764d0","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.099348Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:bba5617047f9131e6ab99c1c007275e94ac0cc41d97752cd5aae411defa05552","observation_id":"42273352-30d9-4d66-b59b-9720cee13b2d","resolution":{"observed_at":"2026-08-06T19:06:27.333739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.311127Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"8c8593fd-a22c-4bab-ac6b-0c599a64cfcb","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.104218Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:9c261a31f6794844cf766b0e7790251c73601c388f2e217ef2604a8545fbee1d","observation_id":"6980ee7d-36ad-44b6-8cc9-56000f31aaa3","resolution":{"observed_at":"2026-08-06T19:06:27.316401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.294461Z","title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"56e8ea53-02c6-4ed7-b609-9b8c28fa8b29","year":2020},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.108928Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:e5b29ca2f503be3ae5bbfddd76c254c4aa47754ac75506a12a1080799bd8fd9d","observation_id":"f910f7ae-4f18-40d3-a21a-d8be669fb90d","resolution":{"observed_at":"2026-08-06T19:06:27.299987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00671","last_updated":"2025-04-28T23:27:21Z","snapshot_observed_at":"2026-08-13T12:53:16.746055Z","submitted_at":"2023-02-01T18:58:20Z","title":"QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing","version":3},"cited_work":{"arxiv_id":"2302.00671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.00671","snapshot_observed_at":"2026-08-06T19:06:27.169509Z","title":"QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing","venue":"cs.LG","work_id":"c194aeb4-3aac-4ada-a45b-7c1a86af0b9d","year":2023},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.113427Z"},"links":{"cited_paper":"/paper/2302.00671","citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:c5e7b66c53af1754d6e27284d9e8edfca584d4ff36f73e2f933dd508f72d62dc","observation_id":"ac343e8c-760f-49a8-ba43-6f5424df160a","resolution":{"observed_at":"2026-08-06T19:06:27.177284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.276779Z","title":"CUP: Critic-guided policy reuse","venue":null,"work_id":"21fa4fea-b845-47d7-8406-c4ea4473eee4","year":2022},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.118550Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:b2e69ce796c5b56c82743fc0e38410d8c299517f8a7340ec594adfcebd1e84ea","observation_id":"471e7da7-456e-48e7-941e-bb1777e50947","resolution":{"observed_at":"2026-08-06T19:06:27.282117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.260627Z","title":"t+K−1X t′=t γt′−t (Ri(st′, at′) +αiH(πi(·|st′))) # + γKEst+K∼Pi h ˆQ˜g i (st+K, i) i = Eat′ ∼πi,st′+1∼Pi","venue":null,"work_id":"fc0ed0fc-b588-4f39-8ad6-6a083eebc193","year":2021},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.123453Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:a43b7dffb6701e5792d9e4053b5a5c7feac2403e208e9c5247f8105435454067","observation_id":"25376279-8414-45bf-8121-e2fe020ec629","resolution":{"observed_at":"2026-08-06T19:06:27.265399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:27.245059Z","title":"Under the initial episode length setting of 150 timesteps, 42 tasks achieve a success rate exceeding 90%","venue":null,"work_id":"03d2128d-d395-4202-8b0a-e6424316b7b8","year":null},"citing_paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-06T19:06:27.128981Z"},"links":{"citing_paper":"/paper/2507.06615"},"observation_digest":"sha256:32befcf571cc6c7f695206ba44e9a1111f5dfa2c5261520080ad1f8373318f4c","observation_id":"ef72a0e4-770a-45bb-ab68-b30d2601b72d","resolution":{"observed_at":"2026-08-06T19:06:27.250052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06615","last_updated":"2025-07-09T07:36:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T21:55:36.634753Z","submitted_at":"2025-07-09T07:36:28Z","title":"Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.06615."}