{"as_of":"2026-08-20T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2d1914a57f1d50798e426e3537c8ac6e7115ff87eda3d5b5d3868249c556a84","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:28:35.482762Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.04879/citation-record","integrity":"/paper/2501.04879/integrity","json":"/paper/2501.04879/citation-record.json","paper":"/paper/2501.04879"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.766198Z","title":null,"venue":null,"work_id":"c8a92924-7c85-48d4-97a8-ea2f43b32e8c","year":2018},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:33.918299Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:357b790160ddf71563b998a346d8d3062db1566ce93de5707eafd033683f0c18","observation_id":"122e959a-67c9-4e7a-ac5d-7c0a6e5f6c8e","resolution":{"observed_at":"2026-08-10T21:28:37.771644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.667719Z","title":null,"venue":null,"work_id":"2fabec8d-41b2-4839-a04c-45dfa27fbe6c","year":2019},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:33.996014Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:c7c67f6a0b23a7b1b00e4e46f9052c5026381e632fce44d8d3bec9e336a299a9","observation_id":"b70a9f9b-58e7-4102-ab42-332a8231ef18","resolution":{"observed_at":"2026-08-10T21:28:37.671929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.657381Z","title":"Mastering the game of Go with deep neural networks and tree search,","venue":null,"work_id":"c804941e-0bf0-4621-8aaa-e91771b3dde3","year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.001049Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:741fc1304c4b4f0007c116219aeb69d5d7a95fab84b909d597371aaa099a7e46","observation_id":"05c0604c-6a2f-4948-9d23-e6a87ced3c65","resolution":{"observed_at":"2026-08-10T21:28:37.660833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.605815Z","title":"Mastering the game of Go without human knowledge,","venue":null,"work_id":"3e45fe88-e595-46d0-9dbb-40dca29d2b0d","year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.005807Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:0f4736fd2d4e992810f00e56f5bb01ba394021c3ee6522468eceb04ec9b9cc46","observation_id":"3622e60e-bffa-4581-8951-a13121f04452","resolution":{"observed_at":"2026-08-10T21:28:37.650268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.418933Z","title":"Language models are few-shot learners,","venue":null,"work_id":"39da4cbb-4f6f-4815-86a3-6ed531780eff","year":2020},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.011538Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:3d1e894783af33b903208bbbc646007d8459165727f754bcc8717b86b4f7277d","observation_id":"5db8c95d-6760-4ffe-abc3-c2a93abe5849","resolution":{"observed_at":"2026-08-10T21:28:37.497353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.407527Z","title":null,"venue":null,"work_id":"de6aa498-bf50-4d26-be0f-287cd34d4aaa","year":2000},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.017654Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:b686138de61fb419048cc42c0b818d2764141ff4c08fd60b24f9e7f917eef910","observation_id":"0a164a31-aa4a-4cf3-84f2-976c91175c1e","resolution":{"observed_at":"2026-08-10T21:28:37.411769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.396125Z","title":null,"venue":null,"work_id":"b01bd232-2f27-4d40-9e5e-be4d4aa5eb02","year":1996},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.023116Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:96a2ccc787f0d711a83db5a81e2b496f364ee5ed9b5b3e32fcb51749c9ac9799","observation_id":"23d01f53-2c08-44ee-b7ba-f6e957432762","resolution":{"observed_at":"2026-08-10T21:28:37.400278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.384184Z","title":"Policy gradient methods for reinforcement learning with function approximation,","venue":null,"work_id":"843a7a68-69fa-48dd-be72-8642d6af7362","year":1999},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.027521Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:80a0d16fc02c9c97791e9dc421266876820378b631ce463ec1439af639f43e41","observation_id":"4b2b8e3d-3130-4d4d-bd2a-a5faa4bdb0f4","resolution":{"observed_at":"2026-08-10T21:28:37.389325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.274564Z","title":"Stochastic policy gradient ascent in reproducing kernel Hilbert spaces,","venue":null,"work_id":"e42a2b91-ff81-4f00-bf45-ecb86ee0a45c","year":2020},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.032248Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:5c4a4f2760c276d7cfab202d535e674cf6a8376ed8da4f93e61b0866c3b49ebf","observation_id":"a842cc04-e702-49c5-8f40-6d12f8188980","resolution":{"observed_at":"2026-08-10T21:28:37.376239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.104779Z","title":"Communication- efficient policy gradient methods for distributed reinforcement learning,","venue":null,"work_id":"652a31cb-a550-4c15-879f-47b33911d091","year":2021},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.070682Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:ad2c77b0c23b6c09273c1f104dae58572d2feccbf4d4adfa2a62d0b2460b4221","observation_id":"7adc6292-3262-4fa9-a4c0-c8bba80c9715","resolution":{"observed_at":"2026-08-10T21:28:37.185601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:37.053795Z","title":"Learning online alignments with continuous rewards policy gradient,","venue":null,"work_id":"9b92e853-c64c-4dae-b666-71e4df5a8f50","year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.133426Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:8c6a08ae9f2751baffba8163ead26dd108ff4e9d5ba9f7882a49719e8754ff4d","observation_id":"0f77fce7-d027-41cf-bd2e-a7850fe97b23","resolution":{"observed_at":"2026-08-10T21:28:37.096965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.936522Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":"dc3ab88a-8d69-4fde-8751-cdaf913c7abc","year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.205990Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:c59e32c3d9d7fa1c1217e45cf23e497f5be1b7ff1dd9fcd6363f44d11f09725b","observation_id":"b8cd722a-c5bf-4da5-94f8-ccfa625142e7","resolution":{"observed_at":"2026-08-10T21:28:36.997948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.924156Z","title":"Compressed conditional mean embeddings for model-based reinforcement learning,","venue":null,"work_id":"8d69ed61-9852-4144-9dd1-5fe24f772a4d","year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.210501Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:2255db3632afa00f2edc403a3cebf2359cc17c67b1c02aac7c72702b06fbb9d5","observation_id":"200e934a-303b-4c48-ad61-a632750fecad","resolution":{"observed_at":"2026-08-10T21:28:36.929358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.909885Z","title":"Nonparametric stochastic compositional gradient descent for Q-learning in continuous markov decision problems,","venue":null,"work_id":"6d94c1cd-cb94-4f5b-a8c5-71c9f02b4c96","year":2018},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.214921Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:475b45b31ff3390d2750e7c90410475ed2c2e5a56203f633bacc2b0a4cabb508","observation_id":"3dc1d551-10ae-47ea-94b4-3ffff318b147","resolution":{"observed_at":"2026-08-10T21:28:36.914568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.853876Z","title":"DDPG-driven deep-unfolding with adaptive depth for channel estimation with sparse Bayesian learning,","venue":null,"work_id":"298e4f0b-8150-4c6c-b3c2-1df1aaeb8ac6","year":2022},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.220933Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:ea55a4dd409d937f7b102d4b8d3ab7ddee3303f4c9d8520b6484ada1a8b543b0","observation_id":"98079f9d-a2d5-4425-99cd-5e6f00f586a4","resolution":{"observed_at":"2026-08-10T21:28:36.900614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.710702Z","title":"Harnessing structures for value-based planning and reinforcement learning,","venue":null,"work_id":"93ff769f-e775-4d88-ae72-80834f9e4ed7","year":2019},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.226229Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:e061598d277ca0bea46906812df251305da78e023f28fb99320c6c806b879b3a","observation_id":"2b2add73-4a90-46a8-9b27-c07eabe7dd34","resolution":{"observed_at":"2026-08-10T21:28:36.784751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.699107Z","title":"Tensor-based reinforcement learning for network routing,","venue":null,"work_id":"31c38687-6959-45cb-9013-a4ca86c3da5f","year":2021},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.230164Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:779848f5e3fbeb75de7bb8c69e22a710e444404bb2c5612fa0c3970110628c14","observation_id":"78f66b58-d38e-4016-b6a5-66dfd13b95b3","resolution":{"observed_at":"2026-08-10T21:28:36.703067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.687053Z","title":"Tensor and matrix low- rank value-function approximation in reinforcement learning,","venue":null,"work_id":"94a3ffe5-9335-4607-9df5-c05ad803c401","year":2024},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.234456Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:3527810870ad1cc28c3fe63f2aa8425050d086e92b7949e187303174d687f17c","observation_id":"22907a49-0cc1-4a2d-8d46-9e8d9190a5e3","resolution":{"observed_at":"2026-08-10T21:28:36.691245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.656798Z","title":"Matrix low-rank approximation for policy gradient methods,","venue":null,"work_id":"6670182b-8928-4483-b9a1-9fe0307c606b","year":2023},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.321016Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:5d6d32b4684a34dd0e6f6cfa3c2599867f3880a8fa6b3af5710f734d5258546d","observation_id":"cb4db96d-1806-4bfa-b69b-b3c08c3a7fa3","resolution":{"observed_at":"2026-08-10T21:28:36.677261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:34.407234Z","title":"The approximation of one matrix by another of lower rank,","venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.407234Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:6d0463b6b33f3cbde3f6db4aa810566749f74931f5c64cdce4d278bca11655d5","observation_id":"c04c2ded-70c0-4ae5-aca2-b5edce2db17e","resolution":{"observed_at":"2026-08-10T21:28:34.407234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.501890Z","title":"Markovsky, Low rank approximation","venue":null,"work_id":"762162b8-b160-4854-8281-3df5d735b133","year":2012},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.450551Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:97ef10826465fe270e62543b02c8a86faf101e84122323713574ca9df2f873d2","observation_id":"9f5299b5-1498-4d4f-a376-a91e83d091c6","resolution":{"observed_at":"2026-08-10T21:28:36.561531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.490337Z","title":"Generalized low rank models,","venue":null,"work_id":"a40dc1bc-2488-4405-b018-df7a3bc8db05","year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.572994Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:d657e1ae9e66b23ff8370f3c1cc3bf5bb2aaaa2f34869751a6c8de4a77bbabf2","observation_id":"7c0854f6-8acd-435b-bdc3-1995b71acd88","resolution":{"observed_at":"2026-08-10T21:28:36.493981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:34.679224Z","title":"Tensor decompositions and applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.679224Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:b8bb2bf34da1eabfea35b1d3dfc64aa7ef4e5dc0827b9acd29132732f9d5f6e4","observation_id":"56c3f893-6226-4ffb-ab6d-49655587652c","resolution":{"observed_at":"2026-08-10T21:28:34.679224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:34.683438Z","title":"Tensor decomposition for signal processing and machine learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.683438Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:28e5d38ead93f0f236906a38d3af2b702af855340599dd09ec2fd6eb7bea4063","observation_id":"2149ad7d-f4f9-4f55-bdf0-82756af82d65","resolution":{"observed_at":"2026-08-10T21:28:34.683438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.465282Z","title":"Flambe: Structural complexity and representation learning of low rank MDPs,","venue":null,"work_id":"ce0ca1e5-3dec-45c8-974b-f093cdffd282","year":2020},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.687493Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:4ab39885d54b1356389bf25e533a4c0ba125c33550a16631cb4005c4deb3b834","observation_id":"608694a9-9143-4a03-84ca-5919484b4577","resolution":{"observed_at":"2026-08-10T21:28:36.469310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.328127Z","title":"Representation learning for online and offline RL in low-rank MDPs,","venue":null,"work_id":"ea89c30f-5b9c-43a3-b10b-476c3df495e1","year":2021},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.709506Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:691f230cd62f65efa51a93f29db48f2fb9eabe2a225bad580b2d4603f1d79890","observation_id":"9a09bca2-8188-4e97-b859-37b0a4881f4e","resolution":{"observed_at":"2026-08-10T21:28:36.418257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.288006Z","title":"Incremental stochastic factorization for online reinforcement learning,","venue":null,"work_id":"f7a75792-dcc9-4bde-92a3-c50abaafc2c0","year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.728184Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:c5edd229abe4cce9e0d364ec8b359a968399ba91bc0de2470a9a21c5e842cbcf","observation_id":"c89cb07b-49be-4c49-ac3f-b5cb756fb4d0","resolution":{"observed_at":"2026-08-10T21:28:36.292215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.276985Z","title":"Contextual decision processes with low Bellman rank are pac-learnable,","venue":null,"work_id":"296e524f-9b92-4b1f-86be-81883d6db5ae","year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.767299Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:d21b5660200a0018cfc0c5157a242f1bd4b6c7ed95804c8fc4b0e0926ccad8b1","observation_id":"68b63fe3-0ee1-440a-81cd-93381dd999cc","resolution":{"observed_at":"2026-08-10T21:28:36.280976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.136639Z","title":"Reinforcement learning of POMDPs using spectral methods,","venue":null,"work_id":"0241fbc0-ae8a-4c33-8ed2-08fd30e05710","year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.861205Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:a495d95a209874bbd23b2407bf0864e81a9a5c3e8873633089975a889a69d383","observation_id":"d4d17fd4-8b0a-4c1b-b0b5-e57d58ed2ca1","resolution":{"observed_at":"2026-08-10T21:28:36.217582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.084502Z","title":"Tesseract: Tensorised actors for multi-agent reinforcement learning,","venue":null,"work_id":"2b858081-bf11-4ac7-9d28-756dca65fdf1","year":2021},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.865996Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:a53049b62466752a78db8a5c25d1807676a391ef8f08e390e1c63a5e780359a3","observation_id":"27f9b7a6-ad12-4fd4-a3af-4ded07fa8b27","resolution":{"observed_at":"2026-08-10T21:28:36.088814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.072661Z","title":"Overcoming the long horizon barrier for sample-efficient reinforcement learning with latent low-rank structure,","venue":null,"work_id":"542eb3e1-7bac-4676-b9cc-daf3566cc503","year":2023},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:34.961314Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:baf1adc92758ac3985a61ed0eabb99aa5aa5caa94d43c763ff8de8eb2e0c94f5","observation_id":"490518e0-6a2d-4957-8880-2df69eb030a0","resolution":{"observed_at":"2026-08-10T21:28:36.076773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.062059Z","title":"Sample efficient reinforcement learning via low-rank matrix estimation,","venue":null,"work_id":"251c111d-480b-4715-9a2c-fa76ad4dbae8","year":2020},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.041546Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:d4ed4a92a206d4c10dad7c766f667928ce28d28c58366bf2972d9b2de611f8d1","observation_id":"1e36f660-d43b-4b34-badb-91a4e1d792c6","resolution":{"observed_at":"2026-08-10T21:28:36.065430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.050230Z","title":"Low-rank state-action value-function approximation,","venue":null,"work_id":"43093d62-5c27-468b-b59a-35ccbdaeb4f3","year":2021},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.101087Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:d2db97b8004bbaa7f5fdfc8fa87204ef9a2cd7c014237b9a912e7be74a5f3f72","observation_id":"4bf59ec7-3f79-4510-9170-653b195741b7","resolution":{"observed_at":"2026-08-10T21:28:36.054337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:36.029047Z","title":"Matrix low-rank trust region policy optimization,","venue":null,"work_id":"4a6e2ea4-6776-4abe-8eb9-7aaa39ccc875","year":2023},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.105128Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:e444eb7407f4cb1a02e21b3274de03d2bfff7b6fbe591b4d6ac03f6f76a6cb60","observation_id":"86881583-83a3-4073-882e-8f72c412f6d9","resolution":{"observed_at":"2026-08-10T21:28:36.042001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.916512Z","title":"Optimization for reinforcement learning: From a single agent to cooperative agents,","venue":null,"work_id":"14f1e581-4102-4555-958a-d2e7553ca944","year":2020},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.114647Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:885b5790434d1cf67fb20655e31473147888ce328f720ad7a27ac05e609ad561","observation_id":"b2396db4-87fa-4186-ba5f-8a6e278029e3","resolution":{"observed_at":"2026-08-10T21:28:35.957147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.906025Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":"245374e5-0b33-4c45-bfde-e1bcca1ef09c","year":1992},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.122737Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:dce2b78c65b53ff5233ac6418bc34451e9ee815e7455359f31fc9ca453621277","observation_id":"29ef7b77-1d80-49f1-8db5-1c2e1ee9dc29","resolution":{"observed_at":"2026-08-10T21:28:35.909507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-10T21:28:35.211211Z","title":"High- dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.211211Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:2357cf0e09d60837cb5c658113b85d7ee93645cf0d4411c4ffa39f5123a1beb9","observation_id":"9ad216e9-59ac-4f96-8fcc-315e5e9a5fa5","resolution":{"observed_at":"2026-08-10T21:28:35.211211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.894772Z","title":"Variance reduction tech- niques for gradient estimates in reinforcement learning","venue":null,"work_id":"9306ba6e-28d6-4768-813f-0346fd9a9430","year":2004},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.314051Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:db6854648572f61119fa747d296d3e4cc2b7067631ce7d44f170b83b87fde3c1","observation_id":"3a04e524-a29f-4a20-8504-23a78c33b608","resolution":{"observed_at":"2026-08-10T21:28:35.898632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.884475Z","title":"Actor-critic algorithms,","venue":null,"work_id":"1c5c7481-8edb-430e-9e2a-c1ea5df97778","year":1999},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.318134Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:cde92aa678225327ea8b0c55224f40ea782bd32dd3761aac7b786529d2af6d3e","observation_id":"623ed208-64b1-4fbf-82c8-7a56f22ca0ec","resolution":{"observed_at":"2026-08-10T21:28:35.888075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.874723Z","title":"A natural policy gradient,","venue":null,"work_id":"8c21a558-e03c-4a1a-9efc-c2a198c2ef4c","year":2001},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.322088Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:355d93adff3b21c23d7ef1bb36d30aa9480f18c5279bd7d3123e4ba945148eb3","observation_id":"8166db67-a7a4-437b-871f-df0ebdf0aca5","resolution":{"observed_at":"2026-08-10T21:28:35.878000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.863164Z","title":"Approximately optimal approximate rein- forcement learning,","venue":null,"work_id":"3e5c222b-63be-4c40-9145-3288ae77aa52","year":2002},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.325860Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:dd57f1eb1e1c3de26a22a69e655b9590e24529b0bd61b89dab00080b21bbbb1d","observation_id":"a3a55557-6df2-4b3c-9f7e-b35541ace1a5","resolution":{"observed_at":"2026-08-10T21:28:35.867295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.756077Z","title":"Trust region policy optimization,","venue":null,"work_id":"22ecf0bf-7b46-4b28-b6ed-2a51fe21b44a","year":2015},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.329911Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:fbd131e1a6efb711dcca57ffdfb2ea3df7edb619cd237816542717f0f74ae2bd","observation_id":"2d2f2fba-7cb7-4dab-aa02-8eba9a53b1d7","resolution":{"observed_at":"2026-08-10T21:28:35.819459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T21:28:35.333560Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.333560Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:c1ba1565259cb8fda580c8e709d5501d7b7ecbe2f54e8c464b7b70e8f4abd8f4","observation_id":"2167e4c2-f01f-496c-b46a-e87e41360cde","resolution":{"observed_at":"2026-08-10T21:28:35.333560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.665440Z","title":"PARAFAC. tutorial and applications,","venue":null,"work_id":"4dfccd5b-b0c2-4d1c-b1b4-80453a5944ed","year":1997},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.338493Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:93f5e011d276d2f2f14b7f59509520354e17a4f547a96ce574102cd94c6b0056","observation_id":"42bb3872-9e47-4a15-ab3e-509f09d3f7be","resolution":{"observed_at":"2026-08-10T21:28:35.669101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.651988Z","title":"Tensor low-rank approximation of finite- horizon value functions,","venue":null,"work_id":"df0ba829-045e-465a-8d6f-d4052afac26f","year":2024},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.343338Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:307837d2cdaa7b97d75277e7a82e1f0bb75792f9a65daf7c8f3ab01832ca41b4","observation_id":"45eb0b67-e29c-4df7-a879-9e968b44c4df","resolution":{"observed_at":"2026-08-10T21:28:35.656184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.640757Z","title":"Amari, Differential-geometrical methods in statistics","venue":null,"work_id":"c4ee4c28-5821-4a54-b4ab-d3e6fec0620e","year":2012},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.347350Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:dff61056c4b743b37051c832b28f232fef5ba231bae716b5d09df66273972c3c","observation_id":"05279c83-5597-444d-b61c-66b07434596b","resolution":{"observed_at":"2026-08-10T21:28:35.644411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.629660Z","title":"Stochastic model-based minimization of weakly convex functions,","venue":null,"work_id":"e52647ae-415f-454f-a1b9-708cf9c0d05c","year":2019},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.387873Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:89936bab12f5db91ae3877033a109e0843724390e9b0669f10148e839f2387b2","observation_id":"2eb51ce7-8bce-44c1-acc4-3a5f40b91082","resolution":{"observed_at":"2026-08-10T21:28:35.633266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.617406Z","title":"Online code repository: Tensor low-rank approximation for policy-gradient methods in reinforcement learning,","venue":null,"work_id":"6ba95f21-f09b-482f-b380-b78305d3225e","year":2024},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.473699Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:cefe81d3f33456bbf6d767d99f38faf8ae4256105e01a2267abb02283d91a14b","observation_id":"ba77206a-c882-4fc6-bd80-853c10ab913c","resolution":{"observed_at":"2026-08-10T21:28:35.621962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T21:28:35.477676Z","title":"OpenAI Gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.477676Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:b88270c6a3d3ae54e13803a6a31bddf8bdcc6d77f28bce74df57a8e305373aee","observation_id":"16c87049-d1b2-4d70-89da-b5fdbe060899","resolution":{"observed_at":"2026-08-10T21:28:35.477676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:28:35.542846Z","title":"Radial basis functions,","venue":null,"work_id":"51f55fb5-c3d2-4fe3-8c96-22feeeb0fda5","year":2000},"citing_paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:28:35.482762Z"},"links":{"citing_paper":"/paper/2501.04879"},"observation_digest":"sha256:7463ba93b66ec588c79ef6811c704a7e604093544f80dfa68c6269384247f4a7","observation_id":"7bfbd494-a15e-409c-bbf2-2a86056271cd","resolution":{"observed_at":"2026-08-10T21:28:35.574825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.04879","last_updated":"2025-01-08T23:22:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T05:40:41.728990Z","submitted_at":"2025-01-08T23:22:08Z","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2501.04879."}