{"as_of":"2026-08-18T00:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d44893db5f582cdc90552b08c6570d11780e5961c55a629482f83cfde2431a37","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:40:59.125143Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:12:29.063618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01919","snapshot_observed_at":"2026-08-02T10:12:29.063618Z","title":"Transformers as multi-task learners: Decou- pling features in hidden markov models.arXiv preprint arXiv:2506.01919, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22646","last_updated":"2026-06-24T17:42:19Z","snapshot_observed_at":"2026-08-14T07:03:58.218378Z","submitted_at":"2026-06-24T17:42:19Z","title":"Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T10:12:29.063618Z"},"links":{"cited_paper":"/paper/2506.01919","citing_paper":"/paper/2607.22646"},"observation_digest":"sha256:bbe97d56e242ec3d1d2134a09c4b6fa1ab29bc8fe4860e82a2b61d16ec8f5429","observation_id":"ed003c3e-4a09-4780-9dd9-fc76dc6516a7","resolution":{"observed_at":"2026-08-02T10:12:29.063618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01919/citation-record","integrity":"/paper/2506.01919/integrity","json":"/paper/2506.01919/citation-record.json","paper":"/paper/2506.01919"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:40:12.667810Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:12.667810Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:ddb918d3c43689884fadd4e38b171671ad6487eda2859b52d9f003c4c1e225b9","observation_id":"b37cdf96-cab3-43d4-9850-c902584a7c54","resolution":{"observed_at":"2026-08-07T11:40:12.667810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.492576Z","title":null,"venue":null,"work_id":"e6ea94b8-30fb-40c2-9af3-4845112868d0","year":2020},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.082855Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:ad6dce197b93fa2828ed8d55c7bb43f6a48ba1ee4599dc9dd0abe6001e683a85","observation_id":"2776fbb9-3174-4dd5-a944-291bb90654cf","resolution":{"observed_at":"2026-08-07T11:41:14.576099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-15T11:54:11.033052Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-07T11:40:23.398864Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.398864Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:686978adae026511ace64c390f315a79522a5fe61393d3c82d457791a2218861","observation_id":"9e33608f-18f7-45d9-9f4e-1fa306a3e8bc","resolution":{"observed_at":"2026-08-07T11:40:23.398864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:23.658854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.658854Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:505945807a9efdeb2ca74112b8c3de8209c3d07a66653fd641971c8569230de8","observation_id":"de0af1fd-b6c7-47bf-80d8-0f98468a9cb7","resolution":{"observed_at":"2026-08-07T11:40:23.658854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.304337Z","title":null,"venue":null,"work_id":"0d4ff5e2-b4bf-46bc-a28d-780c1d8bd1af","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:24.130942Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:62497cca2b497915a949e538dd98e6cacdef21a8426a1af16f5de052c2ed2a46","observation_id":"bb355573-f35e-4bbf-9f23-d86137c98bd3","resolution":{"observed_at":"2026-08-07T11:41:14.394357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.152991Z","title":null,"venue":null,"work_id":"cfb89e6d-e1b5-4f66-ad72-6b85f83dfa64","year":1967},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:31.436082Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:6e03164dfd6cb665546f0a33ae6f1d785562c69d2bdafe8bd6b14b311de4cbc8","observation_id":"5c47feb1-a624-4b5a-8b6a-7963b64d22c2","resolution":{"observed_at":"2026-08-07T11:41:14.225147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:32.879319Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:32.879319Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:624ef2b05e676543b760c935d7f767f262f40c8b20bc344da8ff0c0d5f3edd68","observation_id":"055ae442-6429-4ada-b088-70b6f7c76574","resolution":{"observed_at":"2026-08-07T11:40:32.879319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.939498Z","title":null,"venue":null,"work_id":"3e11db6c-35f1-490e-b501-88375e0edcab","year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:34.930815Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:92ccc1a066800829283112e66fbff922a9393e123eb8cd4e7e2ce46d452db30a","observation_id":"693a0ccf-5081-41c1-97cc-3ab3f968d44d","resolution":{"observed_at":"2026-08-07T11:41:14.017424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-16T16:47:10.413798Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T11:40:35.806691Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.806691Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d8004e8e2db77767db4afdab9fb2053066166d3069cfaae528b00d5fabf9bcde","observation_id":"37303a8d-8c66-443b-b845-98f7ab01a44b","resolution":{"observed_at":"2026-08-07T11:40:35.806691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00507","last_updated":"2019-05-15T18:01:40Z","snapshot_observed_at":"2026-08-14T16:38:33.705519Z","submitted_at":"2019-05-01T21:29:14Z","title":"Learning higher-order sequential structure with cloned HMMs","version":4},"cited_work":{"arxiv_id":"1905.00507","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00507","snapshot_observed_at":"2026-08-07T11:40:59.887908Z","title":"Learning higher-order sequential structure with cloned HMMs","venue":"stat.ML","work_id":"cbbd8d63-ca72-46b8-aaf6-888c90135492","year":2019},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.917029Z"},"links":{"cited_paper":"/paper/1905.00507","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:99494a49fcd3e003ec418e49ad1fde88ebdc90ade3f3b07c8dbdd31b25c3553e","observation_id":"16078ba0-f8ee-4248-88a5-e724faf3065b","resolution":{"observed_at":"2026-08-07T11:40:59.940388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T11:40:35.988583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.988583Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4a1ad015b62271676db57578e55e33ac25430beb4494054dc235799f09187976","observation_id":"6639830b-7776-4d2c-ab1b-dd86daaf804a","resolution":{"observed_at":"2026-08-07T11:40:35.988583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:40:36.043974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:36.043974Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:5d3a9593ca405ebcb86fc8c27894fc173f88f8fbb27349c8bfdf3371c409e19d","observation_id":"856b3693-b88d-428b-8f3b-c6f6e6f6f7f8","resolution":{"observed_at":"2026-08-07T11:40:36.043974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13180","last_updated":"2023-11-24T18:31:21Z","snapshot_observed_at":"2026-08-16T14:41:16.883662Z","submitted_at":"2023-11-22T06:06:54Z","title":"Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks","version":2},"cited_work":{"arxiv_id":"2311.13180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13180","snapshot_observed_at":"2026-08-07T11:40:59.706089Z","title":"Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks","venue":"stat.ML","work_id":"c5e4d322-480d-4cf5-afaf-aec2567760b3","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:36.102914Z"},"links":{"cited_paper":"/paper/2311.13180","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:db7e215bf48188c3fc2e2dd1c97fc9c3374861135b920775bb5fa1e0ecda8c2a","observation_id":"85af8bd4-a4d9-4667-8b5c-42a18f74b032","resolution":{"observed_at":"2026-08-07T11:40:59.778041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.769189Z","title":null,"venue":null,"work_id":"8177f8d7-a05a-4f9f-b63c-f3e3a5860e2d","year":2003},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:46.567180Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:de398b2f4c8019b64368d0637cc6d61e4054c925fca4e834c8adf5941253d12b","observation_id":"dc45da97-be6b-4d0e-ad80-1602fce61a2a","resolution":{"observed_at":"2026-08-07T11:41:13.864748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:53.229870Z","title":"S., and Valiant, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:53.229870Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:ab2c6a0bbe4a7daf87b5f3ab78fbdd208073226382bf03e6748aae9328550ae0","observation_id":"ce7fccea-3bfa-412f-9872-5f705a1749dc","resolution":{"observed_at":"2026-08-07T11:40:53.229870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.649705Z","title":null,"venue":null,"work_id":"d7e8c595-9c7d-41ed-8477-43865710541d","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:54.881823Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:9dcc54d9e8bc1d67c01a2bd222a211466c6c37f9494f71a78ae5046167e1433b","observation_id":"748cf294-8c43-46f6-b1b0-115609ca86c8","resolution":{"observed_at":"2026-08-07T11:41:13.682483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10616","last_updated":"2023-10-16T17:40:49Z","snapshot_observed_at":"2026-08-16T14:51:40.213501Z","submitted_at":"2023-10-16T17:40:49Z","title":"How Do Transformers Learn In-Context Beyond Simple Functions? A Case Study on Learning with Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10616","snapshot_observed_at":"2026-08-07T11:40:55.541675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.541675Z"},"links":{"cited_paper":"/paper/2310.10616","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:c02f3c46ac9ae5bf59d5f2d317e6926b21c4c1d2980a2a1d8dfae2ff8598cccd","observation_id":"371d5abd-36dd-454a-a5e3-c3930026e809","resolution":{"observed_at":"2026-08-07T11:40:55.541675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.468173Z","title":"L., Fard, M","venue":null,"work_id":"2865ad20-8859-4ed8-a550-131667804b95","year":2013},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.869665Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4ea5a4923045a8aef8a19767c2813dabda3dd2bc3a211dcf55be315e78f85dbb","observation_id":"e6110633-2700-40ad-8141-d7ab93d2bfb0","resolution":{"observed_at":"2026-08-07T11:41:13.576491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.240867Z","title":"M., and Zhang, T","venue":null,"work_id":"7e278bb7-53de-433d-a939-5ca628d64e23","year":2012},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.913905Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b9057e54cc730dbb013dd821132ce99fdb908edbdc35a19177df25072021281d","observation_id":"c6a0104b-e2a7-4746-a357-8b40f9b81dc6","resolution":{"observed_at":"2026-08-07T11:41:13.334479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09960","last_updated":"2023-09-13T18:52:02Z","snapshot_observed_at":"2026-08-16T15:39:09.784124Z","submitted_at":"2023-04-19T20:45:01Z","title":"A Latent Space Theory for Emergent Abilities in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09960","snapshot_observed_at":"2026-08-07T11:40:55.929001Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.929001Z"},"links":{"cited_paper":"/paper/2304.09960","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:5235d0ce23421801354bab87fee0f00355e8018e42d78d27ae75872c3cfa0c1d","observation_id":"04cfe5c6-48d7-47bf-9ad2-f2da8a8e07b9","resolution":{"observed_at":"2026-08-07T11:40:55.929001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.028586Z","title":null,"venue":null,"work_id":"2f397e17-f267-4452-bfe1-0473055c3948","year":2015},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.994873Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:15ada54ad074bcb91b75fec9c17299b2b7682ac9314324b42cefed99e38f158a","observation_id":"9667b24a-9dc6-4a70-8616-4d08a9a512a1","resolution":{"observed_at":"2026-08-07T11:41:13.149079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08566","last_updated":"2024-05-26T04:55:19Z","snapshot_observed_at":"2026-08-16T14:52:35.184770Z","submitted_at":"2023-10-12T17:55:02Z","title":"Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08566","snapshot_observed_at":"2026-08-07T11:40:56.046409Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:56.046409Z"},"links":{"cited_paper":"/paper/2310.08566","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:bb5a47f0374cc6f9c976ab616005bcacf6256b733acaaa845583898b73a97b9c","observation_id":"50c28daa-a967-4087-85c5-2fc111ff7716","resolution":{"observed_at":"2026-08-07T11:40:56.046409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:40:57.515045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.515045Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:bd4875dbfb8675e408d52ee40518e150bbf3bf7aa72738cbf8faf9e0ad278f9d","observation_id":"890197f7-e19f-432c-91dc-9beb7e6903c1","resolution":{"observed_at":"2026-08-07T11:40:57.515045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-17T09:16:39.053769Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-07T11:40:57.702995Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.702995Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:f8feb5965771df5d80fbc97fd39238f31c9171eb73673914770e8234976af764","observation_id":"5bae81ac-d125-41e9-bf4f-39ce966d6004","resolution":{"observed_at":"2026-08-07T11:40:57.702995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.798671Z","title":null,"venue":null,"work_id":"9f70b22c-92c4-4419-8814-0fae567f528e","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.754927Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b5d037ba1d833c5e62f07320721803e9f66c474516ffecfcd6cbe3164aa0c48f","observation_id":"06255387-f9d0-473d-b2c2-6b5e540c3c44","resolution":{"observed_at":"2026-08-07T11:41:12.925106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-16T15:17:57.789299Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-07T11:40:57.792547Z","title":"B., and Ma, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.792547Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:ee6e97c681c2b98a119298802896f9781a4b0dde97da788c0a8dafc27b43ad36","observation_id":"fe0c9757-5b8e-414f-9857-a3e00522e994","resolution":{"observed_at":"2026-08-07T11:40:57.792547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.584055Z","title":null,"venue":null,"work_id":"b9cb8ab2-bd80-4855-8513-f56ea12f2748","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.829080Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:fd458b676756cac4e06806dce76d5c5d10471ef4f125a5e186c0048a82d65814","observation_id":"ed888521-334d-46be-b910-a37d407f457f","resolution":{"observed_at":"2026-08-07T11:41:12.710778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14735","last_updated":"2024-08-13T15:45:37Z","snapshot_observed_at":"2026-08-16T14:16:09.696469Z","submitted_at":"2024-02-22T17:47:03Z","title":"How Transformers Learn Causal Structure with Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14735","snapshot_observed_at":"2026-08-07T11:40:57.895555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.895555Z"},"links":{"cited_paper":"/paper/2402.14735","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:05286c1b0cfe3289a1036e63fda0f6a20170ceb601aed184c7dbe855b0502ad3","observation_id":"ff75ee10-68d8-4aa0-8153-f544be1c01b3","resolution":{"observed_at":"2026-08-07T11:40:57.895555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.350480Z","title":null,"venue":null,"work_id":"a7fbb3ad-4284-484e-a91c-9597882b7b84","year":1989},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.908032Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:3c1e3659aacd865b6ec45e618618271a7ead5e801318dcabb93790d20eabb35d","observation_id":"326c245e-c853-4bdb-b297-3cf83230767f","resolution":{"observed_at":"2026-08-07T11:41:12.451322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05787","last_updated":"2024-06-05T13:44:00Z","snapshot_observed_at":"2026-08-16T14:20:10.696997Z","submitted_at":"2024-02-08T16:24:44Z","title":"How do Transformers perform In-Context Autoregressive Learning?","version":2},"cited_work":{"arxiv_id":"2402.05787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05787","snapshot_observed_at":"2026-08-07T11:40:59.458963Z","title":"How do Transformers perform In-Context Autoregressive Learning?","venue":"stat.ML","work_id":"cb37fde8-6523-4456-a875-778564552fdc","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.962510Z"},"links":{"cited_paper":"/paper/2402.05787","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:8990cd8ff02edba0379082adfd14b72180160917ce73f4fe0332b8006b80b2a0","observation_id":"1bbec8c5-d780-4efd-b101-c71eff7e0608","resolution":{"observed_at":"2026-08-07T11:40:59.562424Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.961426Z","title":null,"venue":null,"work_id":"53f35480-9f0d-4a25-a222-cc5b30d4c085","year":2010},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.052249Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d70df613861f21a6f50ebd20eb1802abec394e67b74c37bf8b8da25d3a58787a","observation_id":"bbe4fb67-cc2c-4df4-8f49-8e65cf0b7eb6","resolution":{"observed_at":"2026-08-07T11:41:12.243872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.510485Z","title":null,"venue":null,"work_id":"d8014561-6d98-4c60-963a-09fc76e0e6dc","year":2005},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.072860Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:207e063e87963e58e68858c6d6820fb62ea4156d67c25203767e5911d53dcc5c","observation_id":"d925f7b2-3ae8-4090-8b14-6240d68b8245","resolution":{"observed_at":"2026-08-07T11:41:11.710017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.079206Z","title":"M., Gordon, G","venue":null,"work_id":"45fd3312-b1c6-487d-8cc3-8f892e019500","year":2010},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.089009Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:eacd7c63efdb99feea86e7d5901c1f4c1ceb4d48ec53bc8099bbad3cddc6ec89","observation_id":"779e0284-b2c4-450c-8704-da4d773c4b42","resolution":{"observed_at":"2026-08-07T11:41:11.279696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.671307Z","title":null,"venue":null,"work_id":"b10e71a6-439c-4330-a354-121ace605a20","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.094976Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:edee99f89c98c916798a4c62e8e105891d2f39c698da247e48228b7b55d4adcf","observation_id":"cf229b8a-0ba3-499e-80ec-c0e29e1ddead","resolution":{"observed_at":"2026-08-07T11:41:10.860102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:40:58.150549Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.150549Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:9af71a88f50d4838ad643d8afac02bbea1cad473ac9dc36123262cb8f9c240b8","observation_id":"3cdea488-9094-47f5-a437-92a721f7c29b","resolution":{"observed_at":"2026-08-07T11:40:58.150549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.343855Z","title":null,"venue":null,"work_id":"0e17d062-ff5c-40b9-8c76-b0591f45c755","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.217100Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:f0e3568f412be38a99d298e5e450c150c6ab5f0bdbc503e80115e3c3de971266","observation_id":"d1d4c934-f4a0-4538-9fc2-4ddb244e4398","resolution":{"observed_at":"2026-08-07T11:41:10.501658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.119824Z","title":"D., Kallus, N., and Sun, W","venue":null,"work_id":"95fd7e02-6b22-4be5-b21f-f1b7d621b84c","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.288808Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d8d8efb144f85a346480200015dc8315328f6e280b5ff8aab9418d35211fc8a1","observation_id":"f2c721da-71f6-4cf5-b227-b7e4ecb95e08","resolution":{"observed_at":"2026-08-07T11:41:10.221761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04652","last_updated":"2022-01-06T04:33:56Z","snapshot_observed_at":"2026-08-16T17:50:36.690049Z","submitted_at":"2021-10-09T22:04:34Z","title":"Representation Learning for Online and Offline RL in Low-rank MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04652","snapshot_observed_at":"2026-08-07T11:40:58.356295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.356295Z"},"links":{"cited_paper":"/paper/2110.04652","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:546bc16a90c4b73026cd5871151f5290aba2ade32a24fd1de6df4e1ade13fa9c","observation_id":"8ec3ccfb-8c15-4498-bf95-836c4064540a","resolution":{"observed_at":"2026-08-07T11:40:58.356295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.882336Z","title":"and De Moor, B","venue":null,"work_id":"23281ee9-6113-4e7b-ac48-7dae7e78ea81","year":1995},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.439615Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:53678c3f891b7b76037fcbce4ed922d79ccd8181a49b480fa81925bd9355fc0e","observation_id":"d11c2078-b3e0-4003-85bc-00a0f8735915","resolution":{"observed_at":"2026-08-07T11:41:10.002634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.679864Z","title":null,"venue":null,"work_id":"020ce9ae-e10c-43e0-86a1-2bad7ebe361a","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.508919Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:8382ac4a079f9946c6b347596f64302c2013b9f18563c131cec54481b92112b7","observation_id":"b144fd76-23a1-4a73-8fea-c564226b56d4","resolution":{"observed_at":"2026-08-07T11:41:09.757295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13476","last_updated":"2024-04-01T01:53:31Z","snapshot_observed_at":"2026-08-16T20:10:29.635728Z","submitted_at":"2022-05-26T16:34:46Z","title":"Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency","version":2},"cited_work":{"arxiv_id":"2205.13476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13476","snapshot_observed_at":"2026-08-07T11:40:59.329804Z","title":"Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency","venue":"cs.LG","work_id":"f279114c-9e2c-4d4c-a3f8-0b1ced627d21","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.622315Z"},"links":{"cited_paper":"/paper/2205.13476","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:2c48c3438e8fdef9dfa7a63677826f86a9321937a59ad4a94fab9d2b0eb8b385","observation_id":"7e694279-6e89-4837-8944-32f5895c4042","resolution":{"observed_at":"2026-08-07T11:40:59.387616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11916","last_updated":"2024-02-12T23:09:40Z","snapshot_observed_at":"2026-08-16T15:59:38.246095Z","submitted_at":"2023-01-27T18:59:01Z","title":"Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11916","snapshot_observed_at":"2026-08-07T11:40:58.649659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.649659Z"},"links":{"cited_paper":"/paper/2301.11916","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:6dc4e7d3e7c4df8590ea3c1bf3100340756a31d076614a7706aaf096eeb8c144","observation_id":"31ef48d3-c761-481b-8322-7b40f84d5bf2","resolution":{"observed_at":"2026-08-07T11:40:58.649659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T11:40:58.654553Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.654553Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0109aa7283cfdd14c0df5590bf8c0150a40945f484545e1860ec81cb185cfc40","observation_id":"61bfc8df-6e29-498f-a4bb-b80796adfafa","resolution":{"observed_at":"2026-08-07T11:40:58.654553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03383","last_updated":"2025-02-05T17:18:55Z","snapshot_observed_at":"2026-08-16T02:04:39.624397Z","submitted_at":"2025-02-05T17:18:55Z","title":"Transformers and Their Roles as Time Series Foundation Models","version":1},"cited_work":{"arxiv_id":"2502.03383","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03383","snapshot_observed_at":"2026-08-07T11:40:59.236173Z","title":"Transformers and Their Roles as Time Series Foundation Models","venue":"cs.LG","work_id":"73a733b3-6b61-41f1-b04c-e63e494086e6","year":2025},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.659411Z"},"links":{"cited_paper":"/paper/2502.03383","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0b6c61bdb3e6c1a762540c557b501c8cdb1ef9c1bbd3e57ecad6a72d8c6efb4e","observation_id":"731d3c29-9af1-406b-9439-20e3501f0d56","resolution":{"observed_at":"2026-08-07T11:40:59.244921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-07T11:40:58.725453Z","title":"M., Raghunathan, A., Liang, P., and Ma, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.725453Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:1c0f9bf13ff6d51401323c8bc917e05e5cae89925a158751e064f86447e0b16c","observation_id":"9d9de378-adb2-4292-99b9-f01158159a3d","resolution":{"observed_at":"2026-08-07T11:40:58.725453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.405496Z","title":null,"venue":null,"work_id":"080f51bf-5852-42ed-8f0b-b85fcc146377","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.810045Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:5d63a2a977eaccbaf17d951ba28c8b367852ec3a8f3fa0c829347324ffa616b5","observation_id":"7ddbca05-3e2f-4a35-a360-4dbf9c978d31","resolution":{"observed_at":"2026-08-07T11:41:09.531435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.163034Z","title":null,"venue":null,"work_id":"d9947c3c-b95a-4bfc-9a8b-d4ac9fe7a9cf","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.900185Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:f90bc74a694a7c4e6c3ad79b326a9643394534a4ac3f1b52f92ba202eda21848","observation_id":"2da23092-c1ae-4d83-8bc9-f31ae897ad70","resolution":{"observed_at":"2026-08-07T11:41:09.288353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05738","last_updated":"2022-08-13T15:21:02Z","snapshot_observed_at":"2026-08-16T16:46:31.460726Z","submitted_at":"2022-07-12T17:57:17Z","title":"PAC Reinforcement Learning for Predictive State Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05738","snapshot_observed_at":"2026-08-07T11:40:58.992054Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.992054Z"},"links":{"cited_paper":"/paper/2207.05738","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:14d375b0ce21bf36d60b10450780aadb428ab2f6860acac3c621d9525eda623a","observation_id":"a4394478-de6c-47ae-8fce-b8b756c13a87","resolution":{"observed_at":"2026-08-07T11:40:58.992054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:00.009097Z","title":null,"venue":null,"work_id":"a3089ee2-fd36-47a6-965a-7bd2d2dab269","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:59.082190Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0ea1e038d3f7e5775e07cfd316b707cdd033e6704e3a62c252375b864777a6ea","observation_id":"921f6718-d955-4964-b11a-baad02b271c8","resolution":{"observed_at":"2026-08-07T11:41:08.735863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01962","last_updated":"2023-06-30T13:05:42Z","snapshot_observed_at":"2026-08-16T16:18:48.549126Z","submitted_at":"2022-11-03T16:42:40Z","title":"GEC: A Unified Framework for Interactive Decision Making in MDP, POMDP, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01962","snapshot_observed_at":"2026-08-07T11:40:59.125143Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:59.125143Z"},"links":{"cited_paper":"/paper/2211.01962","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:af246ea7cb6587a4c0420fbc10c9c050b60cbc2e4997805d82f0ff6cc80aec1d","observation_id":"cd2b7cde-9753-4264-84e6-239d9620c0e8","resolution":{"observed_at":"2026-08-07T11:40:59.125143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T02:05:22.144481Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":5},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.01919."}