{"as_of":"2026-08-14T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3dd3c1642101746a3a64293a679a96d70d3c11b66a76dfd2074e8c3e09196967","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:48:43.508912Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16288/citation-record","integrity":"/paper/2506.16288/integrity","json":"/paper/2506.16288/citation-record.json","paper":"/paper/2506.16288"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-06T23:48:38.888821Z","title":"What learning algorithm is in-context learn- ing? investigations with linear models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:38.888821Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:3b089426be60ae3cc1c9fd567716101948ac4a39049304dc22f20fd4ed92e90c","observation_id":"94f17705-0efa-4c8f-b421-47824e15711b","resolution":{"observed_at":"2026-08-06T23:48:38.888821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T23:48:39.070148Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.070148Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:56747756956c25b2bf2387d9524dc90a0ff767970715c85d6c35004a717f6242","observation_id":"40f64f2b-99eb-4057-9109-7f69868ba827","resolution":{"observed_at":"2026-08-06T23:48:39.070148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-13T14:48:56.811001Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-06T23:48:39.299295Z","title":"Analog bits: Gen- erating discrete data using diffusion models with self- conditioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.299295Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:de21886298588eac5355d8253cf5763baa6c439b030a1b4c3724f19933d78090","observation_id":"71dbcc7d-98ba-4a84-ab08-013cdf62394e","resolution":{"observed_at":"2026-08-06T23:48:39.299295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15618","last_updated":"2022-10-12T10:51:02Z","snapshot_observed_at":"2026-08-14T06:23:17.000639Z","submitted_at":"2022-09-30T17:44:01Z","title":"Beyond Bayes-optimality: meta-learning what you know you don't know","version":2},"cited_work":{"arxiv_id":"2209.15618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15618","snapshot_observed_at":"2026-08-06T23:48:45.150309Z","title":"Beyond Bayes-optimality: meta-learning what you know you don't know","venue":"cs.AI","work_id":"c008ac8d-fd24-43aa-aa91-20f83baf2665","year":2022},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.380074Z"},"links":{"cited_paper":"/paper/2209.15618","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:be3bbed2b98ed08e9fda748acc4bd701f2ae46e700d84d3c4e69fb644125318f","observation_id":"23b16767-c8ad-424b-be6e-c6238d866fb9","resolution":{"observed_at":"2026-08-06T23:48:45.294402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14953","last_updated":"2024-01-26T15:37:16Z","snapshot_observed_at":"2026-08-13T04:33:59.117926Z","submitted_at":"2024-01-26T15:37:16Z","title":"Learning Universal Predictors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14953","snapshot_observed_at":"2026-08-06T23:48:39.492242Z","title":"K., Mat- tern, C., Aitchison, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.492242Z"},"links":{"cited_paper":"/paper/2401.14953","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c629464338578d04c1bb4b571c21734038e3bc756e6a43f2ecb45bc802de4fee","observation_id":"b98ce003-2956-457d-a2d4-3bb0cfe13fbf","resolution":{"observed_at":"2026-08-06T23:48:39.492242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:48:40.045729Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.045729Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:b766b70aa39cf152736d4673fc536af8174f76c541a1f1da14628de2079e2588","observation_id":"125db3a6-fbdf-40be-ae63-4281e1312b1d","resolution":{"observed_at":"2026-08-06T23:48:40.045729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.04584","last_updated":"2022-08-04T17:36:08Z","snapshot_observed_at":"2026-08-13T20:49:31.625018Z","submitted_at":"2020-12-08T17:36:34Z","title":"Distilling Knowledge from Reader to Retriever for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.04584","snapshot_observed_at":"2026-08-06T23:48:40.164696Z","title":"and Grave, E","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.164696Z"},"links":{"cited_paper":"/paper/2012.04584","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:0951c7a6a327aba830241308a8b6e121b5fa1fdb28e589841035f7035c099f11","observation_id":"ed593654-ec87-448a-8235-b04e628dcf7c","resolution":{"observed_at":"2026-08-06T23:48:40.164696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18294","last_updated":"2023-05-29T17:59:15Z","snapshot_observed_at":"2026-08-13T11:30:03.886417Z","submitted_at":"2023-05-29T17:59:15Z","title":"Transformer Language Models Handle Word Frequency in Prediction Head","version":1},"cited_work":{"arxiv_id":"2305.18294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18294","snapshot_observed_at":"2026-08-06T23:48:44.803286Z","title":"Transformer Language Models Handle Word Frequency in Prediction Head","venue":"cs.CL","work_id":"a8d6565b-724d-470a-be45-77e3badbbd55","year":2023},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.371506Z"},"links":{"cited_paper":"/paper/2305.18294","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:c18b912eabff2cace67268be4e8d3f49918275283eadfe8273acb7a6cfb19f49","observation_id":"f87cb6d6-18ac-405a-a528-10d6c054c788","resolution":{"observed_at":"2026-08-06T23:48:44.958567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-13T13:18:49.134404Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03782","snapshot_observed_at":"2026-08-06T23:48:40.536842Z","title":"K., Chan, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.536842Z"},"links":{"cited_paper":"/paper/2412.03782","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:e361f069b260ea93cd59f558b1f72ba371265587890b9b3dd918538056286063","observation_id":"b78e2f5f-391b-4bd1-b70d-39754051f770","resolution":{"observed_at":"2026-08-06T23:48:40.536842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02429","last_updated":"2025-01-13T14:58:30Z","snapshot_observed_at":"2026-08-13T04:27:26.782311Z","submitted_at":"2024-02-04T09:58:42Z","title":"Towards an Information Theoretic Framework of Context-Based Offline Meta-Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2402.02429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02429","snapshot_observed_at":"2026-08-06T23:48:44.480044Z","title":"Towards an Information Theoretic Framework of Context-Based Offline Meta-Reinforcement Learning","venue":"cs.LG","work_id":"618c283c-16c5-4267-b673-9c70aba34ed7","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.652267Z"},"links":{"cited_paper":"/paper/2402.02429","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:be40b3f0395614b73ce96699c9bd7fd0ec0db53a65d2da6948994e644effff7a","observation_id":"91c82530-462e-4fb2-ac1a-cfab562b3042","resolution":{"observed_at":"2026-08-06T23:48:44.606108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04220","last_updated":"2024-08-08T05:06:22Z","snapshot_observed_at":"2026-08-12T23:06:49.174827Z","submitted_at":"2024-08-08T05:06:22Z","title":"Diffusion Guided Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04220","snapshot_observed_at":"2026-08-06T23:48:40.869877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.869877Z"},"links":{"cited_paper":"/paper/2408.04220","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:46e4af97f4112e7e78b626601dfeca013a3cf1d48f0e235b1559f3ce744f94d9","observation_id":"1a72bd3e-90a2-4d86-92b3-d484694218d9","resolution":{"observed_at":"2026-08-06T23:48:40.869877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06859","last_updated":"2021-11-24T21:46:41Z","snapshot_observed_at":"2026-08-09T23:58:13.496901Z","submitted_at":"2021-03-11T18:42:39Z","title":"Understanding the Origin of Information-Seeking Exploration in Probabilistic Objectives for Control","version":7},"cited_work":{"arxiv_id":"2103.06859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.06859","snapshot_observed_at":"2026-08-06T23:48:44.144976Z","title":"Understanding the Origin of Information-Seeking Exploration in Probabilistic Objectives for Control","venue":"cs.LG","work_id":"7771af4c-7fcc-40c7-8e1d-cf0cb4f4b071","year":2021},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.014232Z"},"links":{"cited_paper":"/paper/2103.06859","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:7687e142ac637d720104930e0d41177e549e393091c00a978c39e1bab07446ad","observation_id":"c1a8465b-4d2a-4521-ba30-05d75ae518f3","resolution":{"observed_at":"2026-08-06T23:48:44.297349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T23:48:41.238404Z","title":"Webgpt: Browser-assisted question-answering with hu- man feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.238404Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:474cd18547d470dff6492f1cc0beee2ca8660da8e2939c222dc59722bbaa6278","observation_id":"23b4a6d8-3547-4ea7-808a-152654af5fbd","resolution":{"observed_at":"2026-08-06T23:48:41.238404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17717","last_updated":"2024-11-04T18:48:34Z","snapshot_observed_at":"2026-08-13T04:08:54.093279Z","submitted_at":"2024-02-27T17:52:33Z","title":"AmbigNLG: Addressing Task Ambiguity in Instruction for NLG","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17717","snapshot_observed_at":"2026-08-06T23:48:41.424893Z","title":"and Iso, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.424893Z"},"links":{"cited_paper":"/paper/2402.17717","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:8e537cc527408b6bf68a48a3042891add2d19cab6ca5c78e6feac5ed962f3229","observation_id":"cf58b1a5-6f91-427f-b6e4-1bad83f42003","resolution":{"observed_at":"2026-08-06T23:48:41.424893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T23:48:41.546923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.546923Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:6517c3aef12762aae27282204765fcb3438eda4e0586b7eb1e0d7bda0cb3c3bd","observation_id":"e4193223-d037-41a5-b8ec-363c7b52f2dd","resolution":{"observed_at":"2026-08-06T23:48:41.546923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T23:48:41.642535Z","title":"Ortega, P","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.642535Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:fb630be1f862f0d4cb4eea76e9610b2b074fe4f103c1b2df6f75347b46895bfe","observation_id":"959c59fe-03a0-44dc-8958-dd15504a0437","resolution":{"observed_at":"2026-08-06T23:48:41.642535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04891","last_updated":"2024-04-14T05:12:52Z","snapshot_observed_at":"2026-08-13T11:22:10.109203Z","submitted_at":"2023-06-08T02:38:23Z","title":"In-Context Learning through the Bayesian Prism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04891","snapshot_observed_at":"2026-08-06T23:48:41.749879Z","title":"Peebles, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.749879Z"},"links":{"cited_paper":"/paper/2306.04891","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:8a6d18d5e0b684949d263cf42f45904dabe2689c413c80864f86f814bfa8f399","observation_id":"0d42f79b-8470-4740-a33c-c4b25df37a28","resolution":{"observed_at":"2026-08-06T23:48:41.749879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T23:48:41.998582Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.998582Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:cc2a4e89312a56d062392b37b44a94a3f642560c16f97e4f36cec5a9efeb080e","observation_id":"53ed3057-9575-420f-9188-a7e0bbb29143","resolution":{"observed_at":"2026-08-06T23:48:41.998582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-06T23:48:42.183377Z","title":"M., Raghunathan, A., Liang, P., and Ma, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.183377Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:0cf02007a8b95c4186619d377862af7a5615e8756f19c0a4aab3f030deb9f079","observation_id":"6068db52-04e5-46c5-96ca-47914c2b3bc1","resolution":{"observed_at":"2026-08-06T23:48:42.183377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09240","last_updated":"2025-01-16T01:54:23Z","snapshot_observed_at":"2026-08-13T15:05:06.161635Z","submitted_at":"2025-01-16T01:54:23Z","title":"Task Vectors in In-Context Learning: Emergence, Formation, and Benefit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09240","snapshot_observed_at":"2026-08-06T23:48:42.310398Z","title":"Task vectors in in-context learning: Emergence, for- mation, and benefit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.310398Z"},"links":{"cited_paper":"/paper/2501.09240","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:775af84e89e32decb44ce80a051ef74b058eac7c219fb6d9a015317b80396ce8","observation_id":"58e0303e-f69c-461b-8d9b-bd0b818e5ba0","resolution":{"observed_at":"2026-08-06T23:48:42.310398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09469","last_updated":"2023-11-16T00:18:50Z","snapshot_observed_at":"2026-08-13T05:24:18.732967Z","submitted_at":"2023-11-16T00:18:50Z","title":"Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09469","snapshot_observed_at":"2026-08-06T23:48:42.490680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.490680Z"},"links":{"cited_paper":"/paper/2311.09469","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:9772bdf4ce8b44f5a1941e3320c3902fd030799eb5f1077988e2f5d6ceb01178","observation_id":"7f75c7c1-d6dc-4921-9410-b8353192be3b","resolution":{"observed_at":"2026-08-06T23:48:42.490680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05629","last_updated":"2025-02-19T22:48:13Z","snapshot_observed_at":"2026-08-12T22:28:36.316438Z","submitted_at":"2024-10-08T02:25:38Z","title":"Vector-ICL: In-context Learning with Continuous Vector Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05629","snapshot_observed_at":"2026-08-06T23:48:42.605607Z","title":"Vector- icl: In-context learning with continuous vector represen- tations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.605607Z"},"links":{"cited_paper":"/paper/2410.05629","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:113c0f30e09a43bc7dad12815174e2ee11fd94ada4a25c7724bfadd5305974e6","observation_id":"77733cb0-0401-4916-b3d1-dc960aa3e031","resolution":{"observed_at":"2026-08-06T23:48:42.605607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.787462Z","title":"Xie et al","venue":null,"work_id":"b9a381e6-0419-4cf9-b0ef-87f3adfcbe94","year":2021},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.741580Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:1d3c933d4d7c47c7b21c07074ef505521ed4b419a6ea7bfa708f6578f4c84abe","observation_id":"868fc8cb-55c4-4a2e-b94c-fbed6863a8de","resolution":{"observed_at":"2026-08-06T23:48:46.889631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.614426Z","title":null,"venue":null,"work_id":"e13a2014-7ca7-4c38-b5fd-2ddea402b233","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.823175Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:e68c3d2bef047104aa44951fb27e06cdb7d6c3067a0e5e3952fb57d6734ac528","observation_id":"71b5a4f0-f8ce-4d67-a11d-6a2dfd777247","resolution":{"observed_at":"2026-08-06T23:48:46.702266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.383782Z","title":null,"venue":null,"work_id":"0af10a12-2f86-475b-bfe3-98ad4f16210c","year":1996},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.952881Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:1f3817fdc85ec655e09610404816d486de5fa978a2bce72578bb89f72f9c0b0d","observation_id":"5659bdfb-af6b-4c01-a924-426f72d2284b","resolution":{"observed_at":"2026-08-06T23:48:46.485297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.225424Z","title":"Further, system prompts, such as those used in chatbots, serve to disambiguate the model’s role and task (Niwa & Iso, 2024)","venue":null,"work_id":"a5c2f491-9332-4480-a0ad-22a5707caa17","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.067435Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:b49d8859cd804eabeeba59141b5b7ce0348b2e8b8c0e47f8b8588fe135595715","observation_id":"9619e619-8938-4e72-a1a0-08ad34992a98","resolution":{"observed_at":"2026-08-06T23:48:46.313999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.007252Z","title":"However, theses methods enhance can be seen as addressing cases where the conditional prediction p(xt | x<t, θ), not the task inference, is too difficult for the model","venue":null,"work_id":"c3af8942-c1ac-4afc-8f1b-0c4d28114057","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.185025Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:a1416de125eae9cc21c261fe8f2c0d968c9e4443108157262c91786dc5b0cef7","observation_id":"55fd4966-d295-4cdc-ac4c-7e2843e73a11","resolution":{"observed_at":"2026-08-06T23:48:46.090531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.788739Z","title":"In transformers, this has evolved into early exiting mechanisms (Zhu, 2021), which conditionally terminate processing","venue":null,"work_id":"35d8f926-1397-470a-82f7-d895789046bf","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.231353Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:7517c7ce8d79265e0c0c00b8f827a5b35be10e0c3bf5081cc25834cbc8e3d52d","observation_id":"08868ebf-e618-41fb-b51d-4c5e835334ad","resolution":{"observed_at":"2026-08-06T23:48:45.881161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.539195Z","title":"Additionally, the embedding z may encode high- frequency details from xctx that are hard to sample accurately","venue":null,"work_id":"02984ca2-de17-418d-9f00-b8a7904077a2","year":2022},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.356491Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:2157d6a8964137fdbf4697f62adbe7ca691ebe39c35a1217f80d768c2246d2cb","observation_id":"c138dcd4-b4b3-4915-b30b-0a1d8337a34a","resolution":{"observed_at":"2026-08-06T23:48:45.606173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:45.391394Z","title":"Other hyperparameters are the same as in (Lovelace et al., 2023)","venue":null,"work_id":"fbe30c07-080c-476f-ada7-99f1140059eb","year":2023},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:43.508912Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:f88bd533e47a4d887911380553a4bfa0dd7423d82e6e41bcb1477c4bfd0220c2","observation_id":"b21875f1-a162-41c1-a70b-9780dbcbf530","resolution":{"observed_at":"2026-08-06T23:48:45.442634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T23:48:41.826889Z","title":"and Ho, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.826889Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:03b03a179e12ce0b8dace4542a44ce812472d691584d3ad12f19021115b7eae3","observation_id":"a29f8fdb-ee3a-4cb0-a9e1-091b23fe9896","resolution":{"observed_at":"2026-08-06T23:48:41.826889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/a0020511","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Schick, T., Dwivedi-Yu, J., Dess`ı, R., Raileanu, R., Lomeli, M., Hambro, E., Zettlemoyer, L., Cancedda, N., and Scialom, T","venue":"Psychological Review","work_id":"37fb26e3-3734-4516-82c6-c103a7c11442","year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.913211Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:bfb92303518b7c4c4439d2b168e462f8c2fad0c5ab064690231fe3fafd256c94","observation_id":"381b1a20-d609-4fcd-8eff-a75cfa8244d3","resolution":{"observed_at":"2026-08-06T23:48:43.860153Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:48:39.789296Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.789296Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:2d410afd3b30e9a8a096a94bc2d5eccfd9fdcb4b14f2fae5b9881c80fccb1991","observation_id":"b5b9b46a-6e8e-4a24-9594-38619402dfe5","resolution":{"observed_at":"2026-08-06T23:48:39.789296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:39.174597Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.174597Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:0b5ea6f5e8907a5c4cbdd548f5dd8e846ae4bf1cffb6df53661310c601b524f3","observation_id":"c2151987-b613-4adf-9ef4-067511a0b3bb","resolution":{"observed_at":"2026-08-06T23:48:39.174597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-13T05:42:53.020730Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-06T23:48:42.090341Z","title":"L., Sharma, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:42.090341Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:61cbe0f176a4e08c1288ee32c3a05eaa4283d5004855bb5539b8e13970d31188","observation_id":"9225116f-b9dc-4673-a31f-deaa807e29eb","resolution":{"observed_at":"2026-08-06T23:48:42.090341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:48:46.982020Z","title":"Do llms un- derstand ambiguity in text? a case study in open-world question answering","venue":null,"work_id":"cf56d602-cab1-42c5-a2b0-d73187eba008","year":2024},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.267678Z"},"links":{"citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:437ba06160ed60cc29d377031a13416a3b3a9b5a049fe830f267b4802a57bb76","observation_id":"ad3e892c-8a99-4457-a61d-9d0a1c7a44c4","resolution":{"observed_at":"2026-08-06T23:48:47.065482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19162","last_updated":"2025-06-14T23:01:59Z","snapshot_observed_at":"2026-08-12T23:55:06.360029Z","submitted_at":"2024-05-29T15:06:10Z","title":"Does learning the right latent variables necessarily improve in-context learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19162","snapshot_observed_at":"2026-08-06T23:48:41.127955Z","title":"Does learning the right latent variables necessarily improve in-context learning? arXiv preprint arXiv:2405.19162,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:41.127955Z"},"links":{"cited_paper":"/paper/2405.19162","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:a0d7c2f123ac15190a94704efaecc0004b642473e4c70e822e0f14dd2ae92df9","observation_id":"5763f258-be75-44b1-9827-cc292dce71bb","resolution":{"observed_at":"2026-08-06T23:48:41.127955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12973","last_updated":"2024-01-30T18:59:34Z","snapshot_observed_at":"2026-08-13T18:57:32.763757Z","submitted_at":"2024-01-23T18:59:21Z","title":"In-Context Language Learning: Architectures and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12973","snapshot_observed_at":"2026-08-06T23:48:38.966817Z","title":"In-context language learning: Architectures and algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:38.966817Z"},"links":{"cited_paper":"/paper/2401.12973","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:98332ab0858c1a2aa4a41b8642bbcd16d8f10c4d431cf325a22447d8a0a8e9ac","observation_id":"e1e8f6b3-cd97-4661-ace3-9b8430c64eb2","resolution":{"observed_at":"2026-08-06T23:48:38.966817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07971","last_updated":"2023-03-14T15:24:05Z","snapshot_observed_at":"2026-08-13T12:24:49.528818Z","submitted_at":"2023-03-14T15:24:05Z","title":"A Theory of Emergent In-Context Learning as Implicit Structure Induction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07971","snapshot_observed_at":"2026-08-06T23:48:39.925862Z","title":"Hendel, R., Geva, M., and Globerson, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.925862Z"},"links":{"cited_paper":"/paper/2303.07971","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:eaed7f210f3fbd62957d05aa57a1491312eca1f72c98bb6989984c18ec49605e","observation_id":"0f53c2e4-135e-4923-a896-8eb5ef557d51","resolution":{"observed_at":"2026-08-06T23:48:39.925862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-13T17:50:13.821769Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-06T23:48:39.631083Z","title":"Adaptive computation time for recurrent neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:39.631083Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:a46044a825d0eb031d221f8719240cc1978054c8fc3e9d55eee4e1005b9b88ac","observation_id":"2f038ec8-d941-4055-87ed-93ea990b4feb","resolution":{"observed_at":"2026-08-06T23:48:39.631083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14399","last_updated":"2023-10-20T05:46:14Z","snapshot_observed_at":"2026-08-13T11:53:47.345330Z","submitted_at":"2023-04-27T17:57:58Z","title":"We're Afraid Language Models Aren't Modeling Ambiguity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14399","snapshot_observed_at":"2026-08-06T23:48:40.728627Z","title":"A., and Choi, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:40.728627Z"},"links":{"cited_paper":"/paper/2304.14399","citing_paper":"/paper/2506.16288"},"observation_digest":"sha256:a279c896eec23baef83df8e21985701a52714ab6fa207b6adaa9427cd3d6d582","observation_id":"90f3bcfb-2ae8-4fa9-805e-d66dce55b5d2","resolution":{"observed_at":"2026-08-06T23:48:40.728627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16288","last_updated":"2025-06-19T13:05:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:24:13.217680Z","submitted_at":"2025-06-19T13:05:12Z","title":"Next-Token Prediction Should be Ambiguity-Sensitive: A Meta-Learning Perspective"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":5,"verified_fuzzy":7},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.16288."}