{"as_of":"2026-08-14T12:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22a35c36f8aea95de21f112272ae7312fbbdbc733bd7b52b44d33ca21a066c8a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:32:51.736857Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:10:49.683444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18790","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Torque-aware momentum.arXiv preprint arXiv:2412.18790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2412.18790","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:70a34f84d77163476e78c5d07c9076030dd3b2cbdd38626b19753207197f56d1","observation_id":"14cc53ef-864e-47a6-8a1b-44b2c03b4521","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18790/citation-record","integrity":"/paper/2412.18790/integrity","json":"/paper/2412.18790/citation-record.json","paper":"/paper/2412.18790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.486032Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.486032Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:06a0f90442f667d524fe7f00fd0358adbab3dfa50b28e739183721c3d174b0ef","observation_id":"3bd0bc49-8fe0-4b73-9495-6ab0b52aa7b8","resolution":{"observed_at":"2026-08-11T04:32:51.486032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.620329Z","title":"Momentum improves normalized sgd","venue":null,"work_id":"216e34e5-b6f0-4e63-afe4-fda39aa2f742","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.492514Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d0a1842bff48e4ba7046eb46ef26c6c387bdb86676ad9284e9fc333a2ade6dc6","observation_id":"a4520010-6617-498b-9f28-bf9ba798d09b","resolution":{"observed_at":"2026-08-11T04:32:52.625025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.605271Z","title":"Momentum improves normalized SGD","venue":null,"work_id":"ce820f68-bffb-4f84-84d2-f609a4f40215","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.497577Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:7c55977dc7a59e36729aeddc9725cca129fc8f0aa3706087cfc66745e6f21dbf","observation_id":"d2efd5a3-3d48-4a66-b580-614ad712427a","resolution":{"observed_at":"2026-08-11T04:32:52.609996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.590493Z","title":"ImageNet: A large-scale hierarchical image database","venue":null,"work_id":"2e50150a-481a-447d-8a5f-9651900ac5dd","year":2009},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.502598Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:e4156bc4e6391c4962532294b0614c09fdc91cc2432610c4856dffb33fff82af","observation_id":"cb993925-18f3-4baa-b858-98a40bb90abc","resolution":{"observed_at":"2026-08-11T04:32:52.595197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.575045Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"83ed447f-bcfd-48fc-8113-9cd3a50c413b","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.507620Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:9b639c7349a41b5c9ba42326a6e445273ccae60ef85c11c568d5964e0f6d3480","observation_id":"d79f269c-64aa-4e8a-9b84-8e1006e42ca8","resolution":{"observed_at":"2026-08-11T04:32:52.580488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06325","last_updated":"2022-05-05T17:16:00Z","snapshot_observed_at":"2026-08-13T18:29:01.869209Z","submitted_at":"2021-08-13T17:33:47Z","title":"Continual Backprop: Stochastic Gradient Descent with Persistent Randomness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06325","snapshot_observed_at":"2026-08-11T04:32:51.512603Z","title":"Sutton, , and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.512603Z"},"links":{"cited_paper":"/paper/2108.06325","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:89092b44749f4764203a2136caf49fe231e4f0c2b4009c372967f23f4cb8debe","observation_id":"e8ac5cf3-46be-47d9-a53e-5633a6ef8f9b","resolution":{"observed_at":"2026-08-11T04:32:51.512603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.517646Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.517646Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:7b50c7e306a8712fc1a48c2374fb6e9e17204bec35093df3aa312bd1a643a8da","observation_id":"58c2c43d-472b-4872-bef3-5a9e1b862f29","resolution":{"observed_at":"2026-08-11T04:32:51.517646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00781","last_updated":"2024-04-30T22:52:33Z","snapshot_observed_at":"2026-08-13T00:40:29.210982Z","submitted_at":"2024-03-31T19:57:38Z","title":"Addressing Loss of Plasticity and Catastrophic Forgetting in Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00781","snapshot_observed_at":"2026-08-11T04:32:51.522957Z","title":"Addressing loss of plasticity and catastrophic forgetting in continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.522957Z"},"links":{"cited_paper":"/paper/2404.00781","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:ceca03a9120b9154cf3de3b861370017e0fa92b4070d864b161eea257016635c","observation_id":"b9d53c83-3f6e-401c-ac6d-3736829a5766","resolution":{"observed_at":"2026-08-11T04:32:51.522957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.527848Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.527848Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d6c3a49bd964566843ad49e9281141c1b749b5791761adf2f1a30fac771caaf8","observation_id":"ca54014a-0e33-4824-8fcd-3f3b7476dd45","resolution":{"observed_at":"2026-08-11T04:32:51.527848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.532474Z","title":"Linear mode connectivity and the lottery ticket hypothesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.532474Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:3c8869b1639849e039cc80620c33bfb599c4ba20728c0f2fd8a360391490b3a1","observation_id":"446ea0e8-2aea-419b-b676-d2323e95c686","resolution":{"observed_at":"2026-08-11T04:32:51.532474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.531640Z","title":"Identification of mass, damping, and stiffness matrices of mechanical systems","venue":null,"work_id":"cd4ad09e-32af-4d69-9b92-f236b1aaf051","year":1986},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.537208Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d9b92b0620db7bd054b24308f9633df77e0634f0ea4f9491388eae332e8e9802","observation_id":"fc535de2-a6cb-42d5-abdf-6702b80eb2d8","resolution":{"observed_at":"2026-08-11T04:32:52.536666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09000","last_updated":"2023-06-15T09:54:21Z","snapshot_observed_at":"2026-08-14T04:21:22.338251Z","submitted_at":"2023-06-15T09:54:21Z","title":"When and Why Momentum Accelerates SGD:An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09000","snapshot_observed_at":"2026-08-11T04:32:51.541865Z","title":"When and why momentum accelerates sgd: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.541865Z"},"links":{"cited_paper":"/paper/2306.09000","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c947c4220396e24f2e668409c9b208132205a334a3c871f35a815aa298f79295","observation_id":"f44ef772-cece-4d5a-82b2-5f58cce224e4","resolution":{"observed_at":"2026-08-11T04:32:51.541865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04369","last_updated":"2021-10-08T20:25:48Z","snapshot_observed_at":"2026-08-13T17:56:57.796433Z","submitted_at":"2021-10-08T20:25:48Z","title":"A Loss Curvature Perspective on Training Instability in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04369","snapshot_observed_at":"2026-08-11T04:32:51.546755Z","title":"A loss curvature perspective on training instability in deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.546755Z"},"links":{"cited_paper":"/paper/2110.04369","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:6c2cb49309610060045599f5157fb7e7a846992824e8366f2479045910a72549","observation_id":"4ac4761b-0aab-4904-abf2-3b62158766e0","resolution":{"observed_at":"2026-08-11T04:32:51.546755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.551743Z","title":"The movielens datasets: History and context","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.551743Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:deaa8d1c14a7c45f53df0ddfb16d8267b443a47a4e576350c2c87f18bc7d3e74","observation_id":"f11afb00-e613-4b81-9a07-e1f776606024","resolution":{"observed_at":"2026-08-11T04:32:51.551743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.556315Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.556315Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:be5eb07a9c811d5c0c4315ab8aa98c61f85f277f18fda62a758ef37e12c11f22","observation_id":"20e81eae-3d99-46b9-8830-1be4abc9c601","resolution":{"observed_at":"2026-08-11T04:32:51.556315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-11T04:32:51.560902Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.560902Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c2ee8e11ad1b308957f3134f885f9eb581dd698755cbcfbc463c558a33619337","observation_id":"7d184ec9-a614-44d1-9d6e-77637ec80642","resolution":{"observed_at":"2026-08-11T04:32:51.560902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.497404Z","title":"Accelerated gradient descent escapes saddle points faster than gradient descent","venue":null,"work_id":"168f5bf3-6145-4a56-82dd-b97664f483d2","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.565463Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:3b3d411c2346d19dd1ea40b111a758ca531dc4f89905e4ef03ee2bfb314b2abd","observation_id":"7263299a-421f-4890-a740-8bd513a78528","resolution":{"observed_at":"2026-08-11T04:32:52.502230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.482506Z","title":"When do flat minima optimizers work? Advances in Neural Information Processing Systems, 35: 0 16577--16595, 2022","venue":null,"work_id":"d6798f8d-1292-4665-bb5f-be4002405cb7","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.569847Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:55d1eeaf6eb4e5b75b4b28813211a16cd36c9baec41fed3db73fdf8757c4af0c","observation_id":"a6f35c34-45e8-4b14-9670-3b99c6125429","resolution":{"observed_at":"2026-08-11T04:32:52.487670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.574461Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.574461Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:add4fe4bd1ae794574df9a1defdec37ad3c5896ceb43eceacbd2c9547363f57e","observation_id":"7b8c6740-d399-4905-bb27-e6d35965332b","resolution":{"observed_at":"2026-08-11T04:32:51.574461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.578900Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.578900Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:2f5da4362e0da8acc272c4940e1c00f2c0c45d0176438b6d2cb71b3d989780d9","observation_id":"ae6f4b69-6fed-4b7a-aa06-25f565a711c5","resolution":{"observed_at":"2026-08-11T04:32:51.578900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11958","last_updated":"2024-10-24T23:03:41Z","snapshot_observed_at":"2026-08-13T10:29:14.075438Z","submitted_at":"2023-08-23T06:57:05Z","title":"Maintaining Plasticity in Continual Learning via Regenerative Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11958","snapshot_observed_at":"2026-08-11T04:32:51.583221Z","title":"Maintaining plasticity in continual learning via regenerative regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.583221Z"},"links":{"cited_paper":"/paper/2308.11958","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:1b3c848585d9c6c6ec578cb5c8e3efb4f4ebd432dc6c485c9e9f4dbb165661d9","observation_id":"f2e23cf0-b37e-49c4-b6c6-685bf6d3bb70","resolution":{"observed_at":"2026-08-11T04:32:51.583221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06811","last_updated":"2024-10-27T23:45:38Z","snapshot_observed_at":"2026-08-12T23:46:02.856369Z","submitted_at":"2024-06-10T21:34:43Z","title":"Learning Continually by Spectral Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06811","snapshot_observed_at":"2026-08-11T04:32:51.588142Z","title":"Learning continually by spectral regularization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.588142Z"},"links":{"cited_paper":"/paper/2406.06811","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:53d5b93e4f1bd06da2b0f2ed8b282a950dfd34f2cacb553762c2ea94cbe10c5a","observation_id":"2fb49840-e9bd-49c1-9ecf-492854a9de09","resolution":{"observed_at":"2026-08-11T04:32:51.588142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.593008Z","title":"Learning without forgetting","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.593008Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:075b136d9a3ea14cdbe63fab049ad0ce62cd2780e976d026e768d413cb0d1bf2","observation_id":"dec1ceb5-15da-4a3e-ae10-03b0e844546e","resolution":{"observed_at":"2026-08-11T04:32:51.593008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.437978Z","title":"The clear benchmark: Continual learning on real-world imagery","venue":null,"work_id":"d07db64b-d989-417a-9cef-3184f38a88bd","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.597438Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:e9cf2ec27851cfa7d64b5044aa74f879a2d1f5e63fcf370215f1fabdb1ce5309","observation_id":"5ffebe9f-e5eb-43ce-8219-2c3620fda60d","resolution":{"observed_at":"2026-08-11T04:32:52.443659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.422277Z","title":"An improved analysis of stochastic gradient descent with momentum","venue":null,"work_id":"badf497a-b8cb-4228-a0d8-b763bc325034","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.601850Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:7bec4132310d858f65169878b7d9229b458cd8d6c330f5d3f0ca4f00cbb6f6d3","observation_id":"b6d15204-6323-4b25-83a8-50444d955f57","resolution":{"observed_at":"2026-08-11T04:32:52.427027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00325","last_updated":"2019-05-01T14:09:52Z","snapshot_observed_at":"2026-07-06T06:31:14.582990Z","submitted_at":"2018-04-01T17:53:03Z","title":"Aggregated Momentum: Stability Through Passive Damping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00325","snapshot_observed_at":"2026-08-11T04:32:51.606150Z","title":"Aggregated momentum: Stability through passive damping","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.606150Z"},"links":{"cited_paper":"/paper/1804.00325","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:48ca7d5c116ae05cb8ede5e681543598de2f12f46b6e1188ff201d78fdf8c3ce","observation_id":"c00b0143-3083-426e-bbe1-c07367600d46","resolution":{"observed_at":"2026-08-11T04:32:51.606150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-12T23:30:53.722145Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-11T04:32:51.611027Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.611027Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:3841f5e29a61af04aff7af78ba361c01dddd9040e2daa4cd44a64d6385fead5e","observation_id":"2c8b0a50-84f4-4296-b9df-2e0846699123","resolution":{"observed_at":"2026-08-11T04:32:51.611027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18762","last_updated":"2024-02-29T00:02:33Z","snapshot_observed_at":"2026-08-13T04:07:47.729608Z","submitted_at":"2024-02-29T00:02:33Z","title":"Disentangling the Causes of Plasticity Loss in Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18762","snapshot_observed_at":"2026-08-11T04:32:51.615662Z","title":"Disentangling the causes of plasticity loss in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.615662Z"},"links":{"cited_paper":"/paper/2402.18762","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c38a70ab39d313b5a58fac32b3e376acfb80522303df00b94545f241722df2c3","observation_id":"8175a7f3-e989-4ff1-8817-f7e9d5cf2781","resolution":{"observed_at":"2026-08-11T04:32:51.615662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.406525Z","title":"The wikitext long term dependency language modeling dataset","venue":null,"work_id":"a9fe0f92-7d80-4f1a-becb-bde693b96455","year":2016},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.620235Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a2ddd3aa6d90aa63a3ac4a89b4702014e41d388fd73ce1255597e9b57204f3eb","observation_id":"61973c33-69e1-437b-9906-5e41d8b08a19","resolution":{"observed_at":"2026-08-11T04:32:52.411629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-08-14T05:00:07.792972Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-11T04:32:51.624772Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.624772Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:127289994f8771726b50a4eb55a77aaf87fadcb1feb333712c61edbdef5299f3","observation_id":"25ba4763-e529-4702-84cf-0aa7b412f240","resolution":{"observed_at":"2026-08-11T04:32:51.624772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.390040Z","title":"A method for solving the convex programming problem with convergence rate O (1/k^2)","venue":null,"work_id":"a840970e-6525-4dab-b828-6ac5ba3c45c4","year":1983},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.629958Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a670154ae30c13ea0213dd971ddbf6035499b680cdced5def35282183dd8b64c","observation_id":"b6f22a7f-d96e-4b2f-8e87-6f9568e5a13f","resolution":{"observed_at":"2026-08-11T04:32:52.394814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.374273Z","title":"Reading digits in natural images with unsupervised feature learning, 2011","venue":null,"work_id":"349a4627-16af-4c1a-83e1-d81b384ae4d2","year":2011},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.634257Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:76932fe13a1e508c29194072fc06e7444e43001a9132855be62cc4c67b130012","observation_id":"217bbaaf-e509-49d0-976d-a36ca2a39a46","resolution":{"observed_at":"2026-08-11T04:32:52.379517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08242","last_updated":"2023-08-15T07:43:44Z","snapshot_observed_at":"2026-08-13T15:22:38.080156Z","submitted_at":"2022-06-16T15:22:39Z","title":"Catastrophic overfitting can be induced with discriminative non-robust features","version":2},"cited_work":{"arxiv_id":"2206.08242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08242","snapshot_observed_at":"2026-08-11T04:32:52.001952Z","title":"Catastrophic overfitting can be induced with discriminative non-robust features","venue":"cs.LG","work_id":"58ba2cfa-0f5f-46e2-bf22-f05111d8053c","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.638508Z"},"links":{"cited_paper":"/paper/2206.08242","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:99cd76e476a8178cd9802c2799caa722fe6ee816388cd6c1543140ace118d735","observation_id":"5c528bdb-0146-4321-8c6f-c43e1a3e9390","resolution":{"observed_at":"2026-08-11T04:32:52.009051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.358926Z","title":"Some methods of speeding up the convergence of iteration methods","venue":null,"work_id":"af0f3c82-9ced-4c5a-b821-962612d75391","year":1964},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.643170Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:f82d7749b448513fd3030ea2cfc0ac3733387090b8bb55811063d40c0fc73182","observation_id":"6f6a3089-945a-47cb-b18e-b42977f5a354","resolution":{"observed_at":"2026-08-11T04:32:52.363836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.647768Z","title":"On the momentum term in gradient descent learning algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.647768Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:155ecabdf15e69bfe41521da683a6cc18d0db499e2f9a4cc7b945ff82eca8b3f","observation_id":"755b0160-f74d-4607-92ec-fd61ec593859","resolution":{"observed_at":"2026-08-11T04:32:51.647768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10190","last_updated":"2023-09-09T10:53:50Z","snapshot_observed_at":"2026-08-12T06:39:11.422472Z","submitted_at":"2021-05-21T08:00:53Z","title":"AngularGrad: A New Optimization Technique for Angular Convergence of Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.10190","snapshot_observed_at":"2026-08-11T04:32:51.652153Z","title":"Angulargrad: A new optimization technique for angular convergence of convolutional neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.652153Z"},"links":{"cited_paper":"/paper/2105.10190","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d0b380d806844caf3a917c50900ec174b4ebc9aa93e57ecfbb81c25355180885","observation_id":"7953ca69-a6e8-4a5f-8234-f6516e50ab1c","resolution":{"observed_at":"2026-08-11T04:32:51.652153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.334383Z","title":"The dormant neuron phenomenon in deep reinforcement learning","venue":null,"work_id":"6a60dc60-e8ea-4bbf-96d8-9ce1e849ce8a","year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.656628Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:f5bf85b01fa8cfed16d0a8103f46c7d1a1325831a17d511e50cbda28062cc3e7","observation_id":"df1aedab-aced-4f73-957a-8905c0d8e024","resolution":{"observed_at":"2026-08-11T04:32:52.339338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.660773Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.660773Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a52bb84eaaecf294920497bdcf9b65cf2770ab575290d25f1d6fe70ddd52a167","observation_id":"a2224b0d-2151-435d-9d8f-15c995c1b950","resolution":{"observed_at":"2026-08-11T04:32:51.660773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.310446Z","title":"Inversion of friction anisotropy in a bio-inspired asymmetrically structured surface","venue":null,"work_id":"6a45785a-d07c-4288-bf5f-2fa79b83fbe6","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.665253Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:fdbda191e8b2ddc13928a8a6f141074d8f0fe310c48175c51b434c268d12fa70","observation_id":"8c90a804-6b02-4144-8b50-96974e23cbf2","resolution":{"observed_at":"2026-08-11T04:32:52.315147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.295001Z","title":"Better sgd using second-order momentum","venue":null,"work_id":"7680e456-7f31-4d33-9098-f7c09dbdba0b","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.669343Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:36328ad4461ada68bd2c0c4fcc49147496e8de15fb1c89539561fa3cba7b7da2","observation_id":"dfcc0275-2b6c-4a48-b236-8a9c253d61cd","resolution":{"observed_at":"2026-08-11T04:32:52.299851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.673603Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.673603Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:4bc93ddacb377a63f99e382674a9ebdc47b6eb7ad85d4f2a1a767aec9fb8d634","observation_id":"ab82cc83-783f-41f6-b879-673412ee39ed","resolution":{"observed_at":"2026-08-11T04:32:51.673603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.269594Z","title":"Positive-negative momentum: Manipulating stochastic gradient noise to improve generalization","venue":null,"work_id":"a1ef1356-2de7-4976-b547-5c4972e3b070","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.677949Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:b93e12d416a66e985f76f6090472532c1b383f740db0f3e2e947a4027d2dfb56","observation_id":"1a4afe6a-b45a-472a-844a-b05009045140","resolution":{"observed_at":"2026-08-11T04:32:52.275319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.254518Z","title":"A walk with sgd: How sgd explores regions of deep network loss? 2018","venue":null,"work_id":"56a03b3e-5bb6-441a-9927-03cb6e926545","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.682636Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:ed08390e651af5fac6b286c750d1a8bfb80fdadd5e1cde17513a060e86663b8c","observation_id":"b55a78a0-717b-4b79-b3e1-2bfb0fac7a00","resolution":{"observed_at":"2026-08-11T04:32:52.259769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10396","last_updated":"2018-08-30T17:00:03Z","snapshot_observed_at":"2026-08-08T07:56:38.386325Z","submitted_at":"2018-08-30T17:00:03Z","title":"A Unified Analysis of Stochastic Momentum Methods for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10396","snapshot_observed_at":"2026-08-11T04:32:51.686959Z","title":"A unified analysis of stochastic momentum methods for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.686959Z"},"links":{"cited_paper":"/paper/1808.10396","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:055198806009d6c52eba2ce93caa397908626f9bf3500bb50e0308acd3853474","observation_id":"138159cb-03ac-4688-809d-32e2a7b6d802","resolution":{"observed_at":"2026-08-11T04:32:51.686959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.238979Z","title":"Adahessian: An adaptive second order optimizer for machine learning","venue":null,"work_id":"c02ceabc-1ed7-4c67-8b32-66a457b54dfe","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.691514Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:ff2cdc9d970dc6e38e90fae61020e8eecaf0d2807d28e3e9232b303803124c82","observation_id":"8ecab353-652a-41fa-af12-1dc2a3e3264f","resolution":{"observed_at":"2026-08-11T04:32:52.244188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-13T18:00:23.125172Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T04:32:51.695893Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.695893Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:431956934c95cb977482e86044f59c92afba0690cee16a12ca6c2a93617625e7","observation_id":"b2b9cbc5-d0bb-462a-885d-3428c5d5359c","resolution":{"observed_at":"2026-08-11T04:32:51.695893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.700685Z","title":"Link prediction based on graph neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.700685Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:6a1663319fa0b669d1dfa9c754512cf282b1de8a42d0991f9343a39548e85785","observation_id":"925b7c6e-64a5-470d-8793-aa8cdd3b4468","resolution":{"observed_at":"2026-08-11T04:32:51.700685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.214228Z","title":"Do you remember? overcoming catastrophic forgetting for fake audio detection","venue":null,"work_id":"fdbdc429-21b2-4636-af7f-ff02eb860400","year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.705046Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d17da382d5e45df4aab30a5b14a12d9eaec5d21340ed58ccd2d562f86d232e97","observation_id":"d1de11b6-8765-4cf8-86c9-c1bedf90187d","resolution":{"observed_at":"2026-08-11T04:32:52.219030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.198788Z","title":"A robustly optimized BERT pre-training approach with post-training","venue":null,"work_id":"c25f6c3a-36aa-41e8-826b-0662230fb946","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.709277Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:43d96774430d291f134e7c6831e11c136b572389d47f80f1a93cc509a5babbfb","observation_id":"c00850af-dca4-45e9-9ad4-0073426e263a","resolution":{"observed_at":"2026-08-11T04:32:52.204141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04839","last_updated":"2021-06-13T21:13:02Z","snapshot_observed_at":"2026-08-12T06:38:28.358146Z","submitted_at":"2020-02-12T08:28:19Z","title":"LaProp: Separating Momentum and Adaptivity in Adam","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04839","snapshot_observed_at":"2026-08-11T04:32:51.721031Z","title":"Laprop: Separating momentum and adaptivity in adam","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.721031Z"},"links":{"cited_paper":"/paper/2002.04839","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:0a252c38f7f458d385331c5d1ebf0d38321a50f0fb88e75be2243c020c79bf7e","observation_id":"4e1cf77f-4fcd-4d09-9f0c-9bab39568898","resolution":{"observed_at":"2026-08-11T04:32:51.721031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.727122Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.727122Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:8dd4085b7d3e2291abd1356037c195c392c2dde176b2ae295cfea04debfed170","observation_id":"7a323d30-51ae-46d6-925d-4f350233341b","resolution":{"observed_at":"2026-08-11T04:32:51.727122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.732010Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.732010Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:dda75a09b9017028f6169e6fbf1f77561e73e19c0ff954c3f7a9e727549f0801","observation_id":"77fe1f1f-72f5-42bf-bcbf-fccb2413c9b4","resolution":{"observed_at":"2026-08-11T04:32:51.732010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.736857Z","title":"ǌd G ( 1 O.fT GS","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.736857Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:301daeb47ad521a7ae85d7c27003ba9dde88cadbd2cbdaca085738d1efe4108e","observation_id":"907ca412-399e-4e40-a891-32422d88bf4f","resolution":{"observed_at":"2026-08-11T04:32:51.736857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2412.18790."}