{"as_of":"2026-08-17T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb265055282ed29645c44a511e59f377b7460dda83887434c85b79afc18996fc","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:59:31.450302Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:02:50.784117Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T23:02:52.433194Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"cited_work":{"arxiv_id":"1909.02291","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.02291","snapshot_observed_at":"2026-08-15T23:02:52.433194Z","title":"Learning Action-Transferable Policy with Action Embedding","venue":"cs.LG","work_id":"36c4a115-87ae-47ec-a6f2-1271171e0ead","year":2019},"citing_paper":{"arxiv_id":"2505.05753","last_updated":"2025-08-29T01:37:51Z","snapshot_observed_at":"2026-08-15T22:55:24.584595Z","submitted_at":"2025-05-09T03:25:43Z","title":"Towards Embodiment Scaling Laws in Robot Locomotion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:02:50.784117Z"},"links":{"cited_paper":"/paper/1909.02291","citing_paper":"/paper/2505.05753"},"observation_digest":"sha256:4b908c3403e92aa8d9a6ebc6849f32e4642770fd126bddc43edc97e114575c13","observation_id":"a48b4f69-0cad-40c4-a1c2-fa3c1e178e87","resolution":{"observed_at":"2026-08-15T23:02:52.439587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.02291/citation-record","integrity":"/paper/1909.02291/integrity","json":"/paper/1909.02291/citation-record.json","paper":"/paper/1909.02291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.972690Z","title":"Unsupervised cross-domain trans- fer in policy gradient reinforcement learning via manifold align- ment","venue":null,"work_id":"54312cbf-b567-4830-a997-44b80c61f029","year":2015},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.287126Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:9248929652cac4329e847e6ad6f7da9d2157969fafe2b94035e0978cfb418dbf","observation_id":"de39eddb-445c-402a-a67b-c79328207b7d","resolution":{"observed_at":"2026-08-14T04:59:31.978481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.941596Z","title":"Jordan, and Philip S","venue":null,"work_id":"c510853c-5b62-4df0-9e8a-a08db154a31a","year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.304211Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:f3c02b6aab9fb3cc8b1cb821413f4312d0192691b3765d780d469282f98d1a17","observation_id":"3a0fd353-4cee-44a5-9e38-ac76efaa8e76","resolution":{"observed_at":"2026-08-14T04:59:31.946157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.07679","last_updated":"2016-04-04T11:27:36Z","snapshot_observed_at":"2026-08-14T22:17:08.384245Z","submitted_at":"2015-12-24T01:31:40Z","title":"Deep Reinforcement Learning in Large Discrete Action Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.07679","snapshot_observed_at":"2026-08-14T04:59:31.310821Z","title":"Deep reinforcement learning in large discrete action spaces","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.310821Z"},"links":{"cited_paper":"/paper/1512.07679","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:95e5f0c7420cd7faccfbc18c0c744ff137c77da49e7acac0f8538d98f1479bb4","observation_id":"2816ba3d-51ed-4a31-a6ac-509fd00172a5","resolution":{"observed_at":"2026-08-14T04:59:31.310821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.926491Z","title":"Model-agnostic meta-learning for fast adaptation of deep net- works","venue":null,"work_id":"73b1a81f-c034-478d-8283-7dacb1a87c18","year":2017},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.316014Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:39d8d96292b8213979b3d1e09f2f5f9fe39d24b12c12e7526bf7bc955b052084","observation_id":"d790df53-df22-442a-9963-6c59e75da393","resolution":{"observed_at":"2026-08-14T04:59:31.932139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02949","last_updated":"2017-03-08T18:09:32Z","snapshot_observed_at":"2026-08-14T21:12:49.992908Z","submitted_at":"2017-03-08T18:09:32Z","title":"Learning Invariant Feature Spaces to Transfer Skills with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.02949","snapshot_observed_at":"2026-08-14T04:59:31.326737Z","title":"Learning invariant feature spaces to transfer skills with reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.326737Z"},"links":{"cited_paper":"/paper/1703.02949","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:27d14cb7aae3e645ec70545a2e85335650e4494e4a4cc67addaa45a0de491a76","observation_id":"9256b2df-d7ea-4e35-ad3f-6b265974d65c","resolution":{"observed_at":"2026-08-14T04:59:31.326737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-14T04:59:31.332103Z","title":"Soft actor-critic: Off-policy maxi- mum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.332103Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:fb4ec6038f9f37314d98523b216d6ab4328d8eb692fcb76f2ab37d0ad2cfd170","observation_id":"1e77f3ba-95b5-4311-ad02-1bcc30aca892","resolution":{"observed_at":"2026-08-14T04:59:31.332103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03758","last_updated":"2018-04-11T00:06:36Z","snapshot_observed_at":"2026-08-14T19:27:15.119699Z","submitted_at":"2018-04-11T00:06:36Z","title":"Universal Successor Representations for Transfer Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03758","snapshot_observed_at":"2026-08-14T04:59:31.367916Z","title":"Uni- versal successor representations for transfer reinforcement learn- ing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.367916Z"},"links":{"cited_paper":"/paper/1804.03758","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:fb49203224a606a029778f5c3e8dbc61e2616c6b4e7ba0200f401f9eb56cfcf1","observation_id":"62b1e3bf-45fc-442d-a58d-6ef81d335aff","resolution":{"observed_at":"2026-08-14T04:59:31.367916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-14T04:59:31.373402Z","title":"Efﬁcient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.373402Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:627fd2ccb58498a194866e558f98ac48e7d3c2ea544846b6d006cf9fe0eca2a3","observation_id":"98d99cb0-919c-49d8-ae6d-9817ec0b39d3","resolution":{"observed_at":"2026-08-14T04:59:31.373402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.826277Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"84aa0d30-a7c5-418e-8510-f6e6fdb3026a","year":2015},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.378233Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:2477adc9ef4879d8a1a6377a3894217bca91ed43144c88b8e46b85869b8d5a36","observation_id":"4db0289f-1a14-4e3e-bac4-e7f1c139b617","resolution":{"observed_at":"2026-08-14T04:59:31.831957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06719","last_updated":"2020-03-19T17:16:00Z","snapshot_observed_at":"2026-07-06T08:44:27.871882Z","submitted_at":"2019-12-13T21:41:39Z","title":"Neural Network Surgery with Sets","version":2},"cited_work":{"arxiv_id":"1912.06719","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.06719","snapshot_observed_at":"2026-08-14T04:59:31.514763Z","title":"Neural Network Surgery with Sets","venue":"cs.CL","work_id":"8a323a6c-1c34-4d2f-906f-c1c9030b736e","year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.382871Z"},"links":{"cited_paper":"/paper/1912.06719","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:4841f2934ca6806528691fe06cc3293e49a0253b73c1685ee4f86d9b23856d17","observation_id":"1f449564-88ef-4ec4-aa42-8c30a13d6311","resolution":{"observed_at":"2026-08-14T04:59:31.520714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.810580Z","title":"Mastering the game of go with deep neural net- works and tree search","venue":null,"work_id":"f0e5c7d3-db08-44f4-94e7-2ac5cb4fa32d","year":2016},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.388505Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:0909c890f5c1065f7a916fbddcd69901a5c07bd868f510dcc1c8ea51f36f1add","observation_id":"d8c54793-2f9e-476b-91e4-d5ab20fd99f9","resolution":{"observed_at":"2026-08-14T04:59:31.816324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.794201Z","title":"Trans- fer learning for reinforcement learning domains: A survey","venue":null,"work_id":"e1075c99-6da7-4fda-bd97-292c7ef85c42","year":2009},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.393385Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:ed5dc7101fe32dc8abb8386aca4f27a36913f2262cb64f7d7708b66443daa109","observation_id":"0f7b3d16-a49f-4d5b-b2ce-a8d0dd0963af","resolution":{"observed_at":"2026-08-14T04:59:31.799113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.744651Z","title":"The natural language of actions","venue":null,"work_id":"642913ee-606f-441e-8ded-bd34930c9ca5","year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.410312Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:d4202c1a035f963b5f4e5cd05fe933acbd0bc95134205170ce4d4ddaa085f3a5","observation_id":"7abd3bfa-dc2e-4d4e-8b70-31c078308587","resolution":{"observed_at":"2026-08-14T04:59:31.751057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.728202Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"8dc6dae1-e13b-4914-910d-842182a159c9","year":2012},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.415520Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:d17bcfa7e13d0093d96075af62e847fbbf3dc3e1f7b5c144515efcd1bbdd9619","observation_id":"73c1782e-792c-49d3-aeac-a29f649e015c","resolution":{"observed_at":"2026-08-14T04:59:31.733802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.693678Z","title":"Dynamics-aware embed- dings","venue":null,"work_id":"a18e9758-b875-4492-9802-6777f34248bb","year":2020},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.426698Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:5eae4247a064b0d4069f1c417da2f73ecc72eb95a76b065595d3904a708fcaee","observation_id":"af256a57-2e18-40d7-831d-61342f0b15f3","resolution":{"observed_at":"2026-08-14T04:59:31.699237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07907","last_updated":"2017-09-26T18:26:06Z","snapshot_observed_at":"2026-08-14T20:45:29.829680Z","submitted_at":"2017-07-25T10:43:35Z","title":"Mutual Alignment Transfer Learning","version":3},"cited_work":{"arxiv_id":"1707.07907","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.07907","snapshot_observed_at":"2026-08-14T04:59:31.488483Z","title":"Mutual Alignment Transfer Learning","venue":"cs.AI","work_id":"5be18bc3-7ebd-47c2-b0b8-f8f24c885cf8","year":2017},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.431761Z"},"links":{"cited_paper":"/paper/1707.07907","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:ad934200cb79bcbca108c579ce9558225bd2afa94369baf424efb39f9ac3d4ce","observation_id":"83211d2d-094f-4071-b234-5b85a7aa2618","resolution":{"observed_at":"2026-08-14T04:59:31.496055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.677030Z","title":"Efﬁcient deep reinforcement learning through policy transfer","venue":null,"work_id":"2411a292-00dd-486e-8ffe-bb96e41231fe","year":2020},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.438430Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:5d7522aeace50108a12809fa8170a735cd95eb79b28289c3aaadecde8f5541e5","observation_id":"299e6919-cdb5-436d-84be-3b017d1e1304","resolution":{"observed_at":"2026-08-14T04:59:31.682421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.659649Z","title":"Learning cross-domain correspon- dence for control with dynamics cycle-consistency","venue":null,"work_id":"33aafe2d-2b93-47bd-b232-10f43b9dede8","year":2021},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.443620Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:c5baa0d2cea3bfa5fe22de1513864a2d486c32ae9efac383f2a02b792e563505","observation_id":"8054339c-49b5-4ae2-a370-e74b9e0f9bfa","resolution":{"observed_at":"2026-08-14T04:59:31.666652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.643711Z","title":"Here, we exhibit action embeddings learned from additional state embeddings in Mujoco and Roboschool tasks","venue":null,"work_id":"af282c87-a30f-4185-af30-8f2e27834148","year":2000},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.450302Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:9ab8d097a29f8e6571e67b9b1e2a904c93b228ceeba2160e6b26f6916aa374b1","observation_id":"641e4d3f-6f19-4b33-8130-8a99fb43c38d","resolution":{"observed_at":"2026-08-14T04:59:31.648570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.877590Z","title":"Gen- eralization to new actions in reinforcement learning","venue":null,"work_id":"9f1adca1-b8e8-4535-9f39-93b9c9eda731","year":2020},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.342798Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:e728269c93157ef0eb7b05cadc4bff618a9fad67d4e97984b22a4e9c54664641","observation_id":"0f7c246f-4c13-4347-9cb9-8e5f8685f207","resolution":{"observed_at":"2026-08-14T04:59:31.883225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.762314Z","title":"Distral: Robust multitask reinforcement learn- ing","venue":null,"work_id":"b625e53a-ade3-4874-993a-bf8ea1ce7049","year":2017},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.404108Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:cc2d95afcaadc596815a8bce8873572a947a28a0dc5600b437895e5af6824f03","observation_id":"9945fb26-064d-4b94-b211-186db1846055","resolution":{"observed_at":"2026-08-14T04:59:31.768137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.778346Z","title":"Transfer learning via inter-task mappings for temporal difference learning","venue":null,"work_id":"c982f94c-fe9a-42aa-ae92-5d35257f4183","year":2007},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.398098Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:ca84551ef0a4fd3d7c86dbb16116e9ecd2432b0d26010f5f201189a4c9d72398","observation_id":"3a70d47a-352a-4018-9a3d-caa4efae52aa","resolution":{"observed_at":"2026-08-14T04:59:31.783354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.711255Z","title":"Mutual information based knowledge transfer under state- action dimension mismatch","venue":null,"work_id":"e4c3a4ba-1f0f-459f-8bf0-abd0d66097c3","year":2020},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.421672Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:bf7e4cdfdbaa9934ab6e3adf24e0264f9f7054d3df59a5e5f181a6e155673f5a","observation_id":"83e6501b-7c02-40b1-9653-95250c36e311","resolution":{"observed_at":"2026-08-14T04:59:31.717039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.860560Z","title":"End-to-end training of deep visuomotor poli- cies","venue":null,"work_id":"ec1a1e42-759e-4067-828f-48cb7a58b026","year":2016},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.353371Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:2cea8491efd83248faf97b3e7676065ff4cd1b1084fe6e3c61a5a5bb15975e40","observation_id":"1b8a83ce-88b3-480f-a7fa-c3d5ea30860e","resolution":{"observed_at":"2026-08-14T04:59:31.866321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10964","last_updated":"2019-01-30T17:30:31Z","snapshot_observed_at":"2026-08-14T17:23:29.794750Z","submitted_at":"2019-01-30T17:30:31Z","title":"Transfer in Deep Reinforcement Learning Using Successor Features and Generalised Policy Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10964","snapshot_observed_at":"2026-08-14T04:59:31.293177Z","title":"Transfer in deep reinforce- ment learning using successor features and generalised policy im- provement","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.293177Z"},"links":{"cited_paper":"/paper/1901.10964","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:a63794b395c9fdbd5b68b5ce765cafd3947921b781e7e2952a8a8c1378e500a6","observation_id":"fbc3eb09-8c62-4fe0-b1cd-b6eeaa3588c4","resolution":{"observed_at":"2026-08-14T04:59:31.293177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.844077Z","title":"Knowledge ﬂow: Improve upon your teachers","venue":null,"work_id":"2aef4f07-32e8-434a-9069-d95ae1239a9f","year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.359344Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:504e5ce495c537255c1c9e46d562314fd7f2fa52ccc3908b53103e02d10ef386","observation_id":"d9afc95c-6888-44c0-a967-b6e6a19551a1","resolution":{"observed_at":"2026-08-14T04:59:31.849887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.911029Z","title":"Z-forcing: Training stochastic recurrent networks","venue":null,"work_id":"19aa5efc-f6d4-4acb-8135-e986f3083f88","year":2017},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.321417Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:08ee6d21daf74047fe92dcbeb17b51dd26079f5a0f5d8209f669a3d04061316e","observation_id":"4e117d65-f4dd-4526-9a29-0e61c50c9ff0","resolution":{"observed_at":"2026-08-14T04:59:31.916388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.895032Z","title":"Long short-term memory","venue":null,"work_id":"3a752245-7d4a-4c0d-9e08-1f9df03c1347","year":1997},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.338141Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:4c5400ba68a3bb2a484d6295b4268b348c468f53176a666a8694c49303d8476e","observation_id":"4794723c-9418-43c7-9097-6cecd0687792","resolution":{"observed_at":"2026-08-14T04:59:31.900493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:59:31.956484Z","title":"Domain adaptation for reinforcement learning on the atari","venue":null,"work_id":"2c0cf6aa-73ce-437a-8314-c8aa333b8e2c","year":2019},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.298548Z"},"links":{"citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:70999ffc76707f65b08becab701488285d09e2e324c0aaf5e4970e08286ee717","observation_id":"b5b84048-ff8d-4b9c-8c50-48ce4754ec90","resolution":{"observed_at":"2026-08-14T04:59:31.961081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-14T04:59:31.347477Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:59:31.347477Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/1909.02291"},"observation_digest":"sha256:98ae42e64e4ac98f433721f0bbc37574d1aa45f4096198899a09160835689f3b","observation_id":"fa0481c6-c718-4571-b216-d05e1f845416","resolution":{"observed_at":"2026-08-14T04:59:31.347477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.02291","last_updated":"2021-05-10T12:24:33Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T17:32:21.846938Z","submitted_at":"2019-09-05T10:02:29Z","title":"Learning Action-Transferable Policy with Action Embedding"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:1909.02291."}