{"as_of":"2026-08-10T07:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fe6559a0868c47c09815e12a673388a74c4c882021bc95f499dd247888a2558","coverage":[{"denominator":162,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:42:36.609859Z","state":"measured"},{"denominator":116,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":116,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:08:58.164654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T10:29:05.384381Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2412.06769"},"observation_digest":"sha256:ff047677c34989124e5c6bba6b226a99584669480dc99daebde8de53af7fc94a","observation_id":"0ba7fdcc-f59d-47c7-a16e-c00c92b7d1a4","resolution":{"observed_at":"2026-05-11T10:29:05.656955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":212,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:841210df4ebf2c89b83800befeca572d94d73af00a802cc2162cb3e856a8527e","observation_id":"0648a563-5a42-4c15-80e8-df5163347832","resolution":{"observed_at":"2026-05-12T08:41:23.588094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-04T10:08:58.164654Z","title":"M., Han, P., Ha, H., Chadha, A., Du, Y., Ji, H., Li, J., and Iqbal, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12311","last_updated":"2026-07-14T09:30:27Z","snapshot_observed_at":"2026-08-10T04:38:01.859097Z","submitted_at":"2025-10-14T09:10:37Z","title":"Learning Latent Energy-Based Models via Interacting Particle Langevin Dynamics","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:08:58.164654Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2510.12311"},"observation_digest":"sha256:fe8b67fddbcf805ebe063cddff2492d3e786f3974fcf6a95cad183606ce98e00","observation_id":"28496935-a384-4c24-94e6-9eb48389bb1d","resolution":{"observed_at":"2026-08-04T10:08:58.164654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2602.01651","last_updated":"2026-04-21T07:48:12Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T05:11:48Z","title":"On the Spatiotemporal Dynamics of Generalization in Neural Networks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:59:44.016444Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2602.01651"},"observation_digest":"sha256:1196334bc25078332efa31574b398994ff773d4fcf659d8843985b3a0d2de55d","observation_id":"4be6f3f6-eff6-42f3-bdc0-db59cd6df58f","resolution":{"observed_at":"2026-05-16T09:00:46.792385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.03878","last_updated":"2026-04-04T22:10:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-04T22:10:28Z","title":"Learning 3D Reconstruction with Priors in Test Time","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T16:47:26.453813Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.03878"},"observation_digest":"sha256:f0c5450faaf09d056e39b57b60dc4c54cb75367c35248a4a378e30ea33f434ab","observation_id":"9014ed6e-12bd-4040-b93e-37d2bb28be88","resolution":{"observed_at":"2026-05-13T16:48:02.686503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.10272","last_updated":"2026-04-11T16:28:27Z","snapshot_observed_at":"2026-07-06T22:58:56.307161Z","submitted_at":"2026-04-11T16:28:27Z","title":"The Phase Is the Gradient: Equilibrium Propagation for Frequency Learning in Kuramoto Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T15:52:13.956464Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.10272"},"observation_digest":"sha256:3770634ccf04656a75714c65e7a091d368cf2c9c6b6ad6b782f608f8b2108444","observation_id":"5c92e538-13c6-42d1-9211-fba34e7489fb","resolution":{"observed_at":"2026-05-11T09:41:04.744352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.11403","last_updated":"2026-04-13T12:44:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T12:44:04Z","title":"One Scale at a Time: Scale-Autoregressive Modeling for Fluid Flow Distributions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:37.663509Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.11403"},"observation_digest":"sha256:053c957c392565dc5a46164f8d42eff97afe9c0e818bc3f7b6ee7496ba38894c","observation_id":"fe2c7e4a-a4da-4a05-a8b9-69ff96f2c005","resolution":{"observed_at":"2026-05-11T09:16:03.648656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.13521","last_updated":"2026-04-15T06:10:12Z","snapshot_observed_at":"2026-07-30T06:08:24.697906Z","submitted_at":"2026-04-15T06:10:12Z","title":"C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:52.920735Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.13521"},"observation_digest":"sha256:ec9003f4329f22a479e582b9eb939b118ba40817afa4f63385fd36bce064ff74","observation_id":"5a60daec-fd0f-471e-9123-40ac7c32f1fa","resolution":{"observed_at":"2026-05-10T13:05:24.967018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2605.07588","last_updated":"2026-05-08T11:02:11Z","snapshot_observed_at":"2026-08-08T22:51:07.276144Z","submitted_at":"2026-05-08T11:02:11Z","title":"Revisiting Transformer Layer Parameterization Through Causal Energy Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:17:32.226166Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2605.07588"},"observation_digest":"sha256:43ae03411a0f4f3f0ec3f8b6c9ac4dd85e0ac3151906cb418d3b63bc3dcdb6af","observation_id":"1748119f-8f81-415d-8d7d-1ffd7fa5b459","resolution":{"observed_at":"2026-05-11T03:45:59.049118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2606.18206","last_updated":"2026-06-16T17:36:33Z","snapshot_observed_at":"2026-08-02T16:48:27.851712Z","submitted_at":"2026-06-16T17:36:33Z","title":"Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T00:38:47.350106Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.18206"},"observation_digest":"sha256:1194625ba6e0f4ef10ebe53b754c6aacec86b6077f818fbba7ba54425edaf81e","observation_id":"19f380de-6671-4109-b2b7-cb06c4cb57a5","resolution":{"observed_at":"2026-06-27T00:40:17.960298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2606.22726","last_updated":"2026-07-03T01:47:59Z","snapshot_observed_at":"2026-08-01T06:55:05.207715Z","submitted_at":"2026-06-22T00:01:05Z","title":"Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T09:15:27.661551Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.22726"},"observation_digest":"sha256:ca2590dae7e9b0ab65132cae39863fd57ae44a28061d4de7c99ea83f2ce488f4","observation_id":"3f8f7420-ec3a-4383-9ddb-7bc804697144","resolution":{"observed_at":"2026-06-26T09:19:16.020819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-07-12T12:50:56.152971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22726","last_updated":"2026-07-03T01:47:59Z","snapshot_observed_at":"2026-08-01T06:55:05.207715Z","submitted_at":"2026-06-22T00:01:05Z","title":"Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T12:50:56.152971Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.22726"},"observation_digest":"sha256:29bbfb036e77b8130009628dd7f6d5c86b53943fc255093541e29df1a20fef34","observation_id":"45e7168a-fde8-4723-aed8-7fc9a26ed397","resolution":{"observed_at":"2026-07-12T12:50:56.152971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-07-14T04:48:14.980753Z","title":"arXiv preprint arXiv:2507.02092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11555","last_updated":"2026-07-13T13:37:47Z","snapshot_observed_at":"2026-07-16T23:19:52.705875Z","submitted_at":"2026-07-13T13:37:47Z","title":"Advancing Optimal Subset Oracle via Learning Relaxation of Neural Set Functions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T04:48:14.980753Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.11555"},"observation_digest":"sha256:6e523c509737b2a8a13518f64eac33c18b69de355da1527c6263e49b2db5765f","observation_id":"630e150a-c971-4459-ba78-25a923b25ffa","resolution":{"observed_at":"2026-07-14T04:48:14.980753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T19:14:27.667342Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17047","last_updated":"2026-07-19T03:23:22Z","snapshot_observed_at":"2026-08-09T12:31:45.560646Z","submitted_at":"2026-07-19T03:23:22Z","title":"Solver-Hard Is Not Model-Hard: A Hardness-Controlled Diagnostic for LLM Constraint Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T19:14:27.667342Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.17047"},"observation_digest":"sha256:f80bbc55e92af4736b4661350362c04824cefe45acf4796c40d1008cca608fb3","observation_id":"1166e9f6-b53f-4b3c-b3fe-9293d38094c5","resolution":{"observed_at":"2026-08-01T19:14:27.667342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T09:25:23.671177Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20792","last_updated":"2026-07-22T23:34:56Z","snapshot_observed_at":"2026-08-03T08:26:10.984255Z","submitted_at":"2026-07-22T23:34:56Z","title":"Memoir: Should a Model Write to Its Memory While It Thinks?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T09:25:23.671177Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.20792"},"observation_digest":"sha256:14544293aab032df2e6a3c3cf48a73b80336796f91905c79a48cf23b1c23201c","observation_id":"7bbbeb4b-a6dd-464f-9e4c-f617d887e72d","resolution":{"observed_at":"2026-08-01T09:25:23.671177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T08:41:08.641850Z","title":"Energy-based transformers are scalable learners and thinkers.arXiv preprint arXiv:2507.02092, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27372","last_updated":"2026-07-29T18:25:17Z","snapshot_observed_at":"2026-08-08T11:48:16.614235Z","submitted_at":"2026-07-29T18:25:17Z","title":"Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T08:41:08.641850Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.27372"},"observation_digest":"sha256:e403abcf04c723d097130cf139926aea13cd31508f838a595bcb1265f7f82e20","observation_id":"450f36dc-7179-4144-a485-09f06cb68896","resolution":{"observed_at":"2026-08-01T08:41:08.641850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02092/citation-record","integrity":"/paper/2507.02092/integrity","json":"/paper/2507.02092/citation-record.json","paper":"/paper/2507.02092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.039207Z","title":"Thinking, fast and slow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.039207Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:20a0ffc4ce0efa228ff1b00111c0e7b027a20801b6d01931d56996c8326a1c28","observation_id":"d6ddae26-85e1-45a8-a31d-ab70cbda7460","resolution":{"observed_at":"2026-08-06T20:42:27.039207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.107408Z","title":"Dual-process theories of reasoning: Contemporary issues and developmental applications","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.107408Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7ff00d169f6e0887936d8217b06fb95dd0740eceae39d76c5286580795597437","observation_id":"b1453c70-fcab-479b-822a-ac4c623d20f9","resolution":{"observed_at":"2026-08-06T20:42:27.107408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.185821Z","title":"Representativeness revisited: Attribute substitution in intuitive judgment","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.185821Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:234640d588431d125b97478550e76d887f31fe1b2e775b112aae7a595ddaf607","observation_id":"b60f4321-59fc-4c6f-9316-13fd6baa9661","resolution":{"observed_at":"2026-08-06T20:42:27.185821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.250112Z","title":"Dual-process and dual-system theories of reasoning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.250112Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a42403292d04081b70e70fa37c3457fd5055cb9724d41b2c5b73ee8fb2877be3","observation_id":"b5aeefc7-b287-49fc-a6ac-979637e310e5","resolution":{"observed_at":"2026-08-06T20:42:27.250112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.303729Z","title":"Dual processing in reasoning: Two systems but one reasoner","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.303729Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ea95151bcf9bd3305a2e3807435e6d865954d22613da0a30799163d04d8ba098","observation_id":"35bc9d69-a7a2-45a2-88d1-8b6b1ae5938e","resolution":{"observed_at":"2026-08-06T20:42:27.303729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.364622Z","title":"Dissociation of mechanisms underlying syllogistic reasoning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.364622Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:33743f90cde1901f7204a6e03b3bc85a49d23dd553f0fb17d3a4b11453766cf2","observation_id":"76480e4e-74f9-44ff-aaef-25c67fae60b6","resolution":{"observed_at":"2026-08-06T20:42:27.364622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T20:42:27.410182Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.410182Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8701b1bf475001a3ef5a3cdb4464e99180e9267e862c3f55cc22f85b9fdc8526","observation_id":"05834008-db06-413a-b1a6-563d060e2195","resolution":{"observed_at":"2026-08-06T20:42:27.410182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-06T20:42:27.462852Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.462852Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:30bce08239a5e1fd86a90fc25e4b94b3becedb10e67ede6f430dd1de015fb23a","observation_id":"35cc0f0b-e247-4a74-bb70-2baa797c3e60","resolution":{"observed_at":"2026-08-06T20:42:27.462852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.513128Z","title":"Do phd-level llms truly grasp elementary addition? probing rule learning vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.513128Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:add4b393041306fcc7f14e8f87e32c2b412c1932888b15ea31ac459e2e27ef0a","observation_id":"d3ed8ee4-10d9-4047-9082-5244128443f6","resolution":{"observed_at":"2026-08-06T20:42:27.513128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.580140Z","title":"Escapebench: Pushing language models to think outside the box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.580140Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:73458d6da59752ed95c82c1fe63b7906267b4acaed1678405222ce3497a98e4f","observation_id":"2edaf2a4-53b2-47b2-b5fb-0b45c014e114","resolution":{"observed_at":"2026-08-06T20:42:27.580140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:42:27.652721Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.652721Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a613099d196f543fe353dce74b87ef1495c9caff601e9df04dfdad92bb2fc83d","observation_id":"91e63716-8981-42d4-8ae5-fa0034279328","resolution":{"observed_at":"2026-08-06T20:42:27.652721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:42:27.723801Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.723801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8ff2db13ad30fddba46af85738037703b537005362a9e3a05085f02d227fbe13","observation_id":"d7467f5c-04d2-4cd4-a016-b551e3c2eba1","resolution":{"observed_at":"2026-08-06T20:42:27.723801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.734421Z","title":"Grok 3 Beta — The Age of Reasoning Agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.734421Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e78d935de86d43d748c2ab5a266d4e9127742db77537de5ea57c77630db1dbb1","observation_id":"039ba5e4-fad0-4346-bc5a-b5dd8c004988","resolution":{"observed_at":"2026-08-06T20:42:27.734421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.812198Z","title":"Claude 3.7 sonnet and claude code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.812198Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:303dc267dfa2650a295a83275eef48e946918c885586581100f5b080aa6b1b1c","observation_id":"934436d7-d49b-4e8f-8289-dc7c202f14dd","resolution":{"observed_at":"2026-08-06T20:42:27.812198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.954135Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.954135Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:9cadcc89ff088dad717b39d599c2acbede80b9ff7aedc2c9b2795a8da8904c1f","observation_id":"40ef9616-cfc2-4240-8f4b-9a1f9b82501a","resolution":{"observed_at":"2026-08-06T20:42:27.954135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-07T21:53:39.516862Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T20:42:28.038550Z","title":"Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.038550Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:057f4c3edd140380e088d9eed8c7ea04b1f6372a37c3ea4b71f28ca2d5d94a97","observation_id":"65d37c96-ba03-4096-9c57-857ff75d8237","resolution":{"observed_at":"2026-08-06T20:42:28.038550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:28.130559Z","title":"The illusion of thinking: Understanding the strengths and limitations of reasoning mod- els via the lens of problem complexity, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.130559Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d8bbce26ed4acf8d061b7581fef8d43cc34f7330b070534093ad8b310d290fff","observation_id":"24d9c52c-a75b-408b-b1c8-26358dfca628","resolution":{"observed_at":"2026-08-06T20:42:28.130559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T20:42:28.214770Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.214770Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:99445b5afc69a3e4e55363c213b3797d7060cd7d699f6997f0b5ab148b24dfb7","observation_id":"0f637e03-8084-4a6d-a282-e8a2af4ee97d","resolution":{"observed_at":"2026-08-06T20:42:28.214770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T20:42:28.340670Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.340670Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5ea02d804183c4b75b763469b824119a00176c24e12e308b55ad87aa7279ca63","observation_id":"62b2b6d2-ff92-4c36-a31b-6a7c366b54af","resolution":{"observed_at":"2026-08-06T20:42:28.340670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18942","last_updated":"2025-04-01T06:52:58Z","snapshot_observed_at":"2026-08-07T16:40:27.846388Z","submitted_at":"2025-03-24T17:59:04Z","title":"Video-T1: Test-Time Scaling for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18942","snapshot_observed_at":"2026-08-06T20:42:28.447718Z","title":"Video-t1: Test-time scaling for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.447718Z"},"links":{"cited_paper":"/paper/2503.18942","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:029586b76c8b1d99cda182c3bc5dccf02c3e27aa66267bcd1a1b43960a8d285e","observation_id":"48e8a96d-48e6-467c-901e-9549f323f18b","resolution":{"observed_at":"2026-08-06T20:42:28.447718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-08-06T20:42:28.538064Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.538064Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b184ae018d2049e737064e6d5e81c28c577345be993ef00406e3b4764d5339ba","observation_id":"4dcbc952-9f12-4832-b1b5-fc6ecd25ff0a","resolution":{"observed_at":"2026-08-06T20:42:28.538064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T20:42:28.597176Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.597176Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cc5097b8a1d6dfe7871b5c21456aa1a5e546258cf9a17d065103502f7f0f84bc","observation_id":"0449bfe8-5100-4ffb-99ed-9058bf6d5c48","resolution":{"observed_at":"2026-08-06T20:42:28.597176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T20:42:28.721324Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.721324Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6c32b8e6b9cac39057718ce7a940dbf729104ba18733964abf2bb65ce2f973ac","observation_id":"3f3aeeba-ce7d-44b5-bcd3-3fdd8d27b453","resolution":{"observed_at":"2026-08-06T20:42:28.721324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:28.816423Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.816423Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e899b9f9562e0ad59b6f6870a2968d41a0a80e564bca5392de5c9a2e0f67a4b4","observation_id":"60208d23-2788-4eda-94c6-d179f4583dfc","resolution":{"observed_at":"2026-08-06T20:42:28.816423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-06T20:42:28.965416Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.965416Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:9ed4eb1288f75df9d71c698a7b87c572eecbcfbc926d2bbb4647711314094b72","observation_id":"8db74f51-d0f9-415f-8686-321fa13d90ac","resolution":{"observed_at":"2026-08-06T20:42:28.965416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.094229Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.094229Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:73938618d60d2eddc6c4d6aa31a9d514c3218a489ea2099c5d2a9ed028885c5b","observation_id":"821711fb-2b6e-4474-aaf0-456b8dc40613","resolution":{"observed_at":"2026-08-06T20:42:29.094229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.227404Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.227404Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3fb1abe5b382ebc635b8bafd074088a7a04f554d74cc64fb57fd768f150649c2","observation_id":"22cf1455-e1b8-484d-875c-c7b460747ff8","resolution":{"observed_at":"2026-08-06T20:42:29.227404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12095","last_updated":"2024-12-17T18:45:55Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:59:29Z","title":"Causal Diffusion Transformers for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12095","snapshot_observed_at":"2026-08-06T20:42:29.386292Z","title":"Causal diffusion transformers for generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.386292Z"},"links":{"cited_paper":"/paper/2412.12095","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7f2fce202b8927359453afc9581bab79921538577ac98dbc50f2814ea05eb863","observation_id":"ec097216-2934-4642-abf3-ae3bc4d81e8d","resolution":{"observed_at":"2026-08-06T20:42:29.386292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-06T20:42:29.538887Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.538887Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:21394977d84d82bceb15e4da7edfcc6264904cbb5865f819cf19f6cef06f1608","observation_id":"b01f2972-59a6-43aa-968a-07d43b819ae4","resolution":{"observed_at":"2026-08-06T20:42:29.538887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02226","last_updated":"2024-04-21T03:39:21Z","snapshot_observed_at":"2026-08-06T21:01:03.193755Z","submitted_at":"2023-10-03T17:32:41Z","title":"Think before you speak: Training Language Models With Pause Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02226","snapshot_observed_at":"2026-08-06T20:42:29.670598Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.670598Z"},"links":{"cited_paper":"/paper/2310.02226","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:983c08a34519c264dd5d8043df5dff08daaadeab84bf0fc35de78a36f76a36e3","observation_id":"7a678ad2-fe4c-488a-b99d-81b9d4b172fe","resolution":{"observed_at":"2026-08-06T20:42:29.670598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.797715Z","title":"Evidence for time-variant decision making","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.797715Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:837f0299ca586b94317bf65ecf5c9c1973120a5a1ecbefe057a7346d4108e2aa","observation_id":"15d0e0ca-f202-42bc-b290-4bc665fefd9d","resolution":{"observed_at":"2026-08-06T20:42:29.797715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.919700Z","title":"Prefrontal cortex and flexible cognitive control: Rules without symbols","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.919700Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:baaf908222e03aecd275ca663fb943d5fce9d05555279bfeb13740de23e9586e","observation_id":"8d6be292-0fc9-465b-ba60-3ecf9f9667a9","resolution":{"observed_at":"2026-08-06T20:42:29.919700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10960","last_updated":"2024-04-16T23:56:38Z","snapshot_observed_at":"2026-08-09T11:43:40.512586Z","submitted_at":"2024-04-16T23:56:38Z","title":"Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10960","snapshot_observed_at":"2026-08-06T20:42:30.055872Z","title":"Uncertainty- based abstention in llms improves safety and reduces hallucinations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.055872Z"},"links":{"cited_paper":"/paper/2404.10960","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:c472a82198f5889e07ebfd1229ac389fbdec4ca370fba27da909cad15c9a867d","observation_id":"2e3591c7-924f-46cb-913b-3e4fa597143b","resolution":{"observed_at":"2026-08-06T20:42:30.055872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.175475Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.175475Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6174531ac5955ffbe738cd2125b61bd4ca96a66549c90f99c0fd5931418ed2af","observation_id":"e1ff8271-ec26-4588-8534-ff370e49e04e","resolution":{"observed_at":"2026-08-06T20:42:30.175475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.313122Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.313122Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d9b135745295a009fb3e3706c93412eb1bd912a6594f79f675d66bd2e0e4f5ba","observation_id":"aad8e0f7-c227-4c04-bef2-4bf10e169e3a","resolution":{"observed_at":"2026-08-06T20:42:30.313122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00826","last_updated":"2022-06-02T01:54:58Z","snapshot_observed_at":"2026-08-05T23:54:54.292058Z","submitted_at":"2022-06-02T01:54:58Z","title":"BayesFormer: Transformer with Uncertainty Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00826","snapshot_observed_at":"2026-08-06T20:42:30.473303Z","title":"Bayesformer: Transformer with uncertainty estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.473303Z"},"links":{"cited_paper":"/paper/2206.00826","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:c9959832e8ff702eeea79e0bc33b76a0529af1f36183e955cd334848b54607f9","observation_id":"e9a59b09-e2c4-44b6-b889-5a11f9de70cc","resolution":{"observed_at":"2026-08-06T20:42:30.473303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.591803Z","title":"Out-of-distribution detection with a single unconditional diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.591803Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6fbdf73c2cf73e860d2472692d730c4c11820f9ddaa56a75f98fdcb7a77cce15","observation_id":"31ef411d-9503-423d-a5eb-961b7665c9c8","resolution":{"observed_at":"2026-08-06T20:42:30.591803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09136","last_updated":"2019-02-24T11:57:32Z","snapshot_observed_at":"2026-07-06T07:09:43.264415Z","submitted_at":"2018-10-22T08:32:02Z","title":"Do Deep Generative Models Know What They Don't Know?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09136","snapshot_observed_at":"2026-08-06T20:42:30.700978Z","title":"Do deep generative models know what they don’t know? arXiv preprint arXiv:1810.09136, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.700978Z"},"links":{"cited_paper":"/paper/1810.09136","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7788653294b8b3d1e241b1da2da720003d3d3e831bb012f13e55bc7f3bc59672","observation_id":"a7c3f0f2-7e51-4ea8-af56-bd5f6bc055fe","resolution":{"observed_at":"2026-08-06T20:42:30.700978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11480","last_updated":"2020-01-17T10:38:05Z","snapshot_observed_at":"2026-08-04T17:57:20.973568Z","submitted_at":"2019-09-25T13:27:53Z","title":"Input complexity and out-of-distribution detection with likelihood-based generative models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11480","snapshot_observed_at":"2026-08-06T20:42:30.846893Z","title":"Input complexity and out-of-distribution detection with likelihood-based generative models","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.846893Z"},"links":{"cited_paper":"/paper/1909.11480","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3ff74cab618840a6424dfbb8f1a060de18f420485bfa8d7a7f5de0049ef757b7","observation_id":"de949469-b5b3-4c4c-a767-486f001a9222","resolution":{"observed_at":"2026-08-06T20:42:30.846893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.930035Z","title":"Mixture density networks","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.930035Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d137488516c19993bb88c203d7af32b7f163dcd28ee5d54883d215c5f8aa99f8","observation_id":"b8357fc2-8119-493a-94dc-c4f3103fb35b","resolution":{"observed_at":"2026-08-06T20:42:30.930035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T20:42:31.046071Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.046071Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:f3ae2cabae10ca12382b84fcc552f5198e8d94a248452ca6ff1d7fdbbfea6c96","observation_id":"54cc5f5c-87b2-4894-a343-a916717a0b4b","resolution":{"observed_at":"2026-08-06T20:42:31.046071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.238098Z","title":"Introduction to latent variable energy-based models: a path toward autonomous machine intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.238098Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b1b7baf102435e7920dfc95d158797d9d31d438355f04767898f19783db5cafc","observation_id":"765bd168-eb1c-4b83-8087-aaf1581cbf03","resolution":{"observed_at":"2026-08-06T20:42:31.238098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.pneurobio.2017.05","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:41.806463Z","title":"Peters, B","venue":null,"work_id":"adf870f7-8b00-4acf-a711-4fc747fd3e21","year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.345522Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:4dd0140423245b95ad5e81a5b26ab113ff70374bdb95d069bf74eb096049ca7d","observation_id":"7b6c72d8-5eb0-4327-bf6c-6e904d4c92db","resolution":{"observed_at":"2026-08-06T20:42:41.901900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.442170Z","title":"Vilares, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.442170Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:37b362eaf6b12abd1b2c51b7a44993aa8265ecc290291b690eb568bf00c926d9","observation_id":"c16a1053-0ad7-4701-9d37-da136aa84d2f","resolution":{"observed_at":"2026-08-06T20:42:31.442170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/cercor/bhp155","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Sarinopoulos, D","venue":"Cerebral Cortex","work_id":"2e93682d-e7c1-4ac6-854e-582d34860126","year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.750808Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3f478d5049d4aa957798c690c39fba9192b74459eb1932a010ef001672dc1a66","observation_id":"e6bb566b-dadb-4c0e-9b72-0076d5a63fd9","resolution":{"observed_at":"2026-08-06T20:42:41.580639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.909144Z","title":"Paving the way to eureka—introducing “dira” as an experimental paradigm to observe the process of creative problem solving","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.909144Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:441f57f332c86cb9aef83b549bbd46bc66f9ca31e6ad0c43b8b514cc877dbff5","observation_id":"31974327-9901-45e0-8bb7-a3612916761e","resolution":{"observed_at":"2026-08-06T20:42:31.909144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.050358Z","title":"Using contents and containers to investigate problem solving strategies among toddlers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.050358Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d169e9dd01314290bbbbaf759dda5aae97731e5c742218bddbc6a30c4a0a6a8e","observation_id":"43347ce9-4ff7-4a4c-9c81-2757c0eeecc3","resolution":{"observed_at":"2026-08-06T20:42:32.050358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.154915Z","title":"Learning iterative reasoning through energy minimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.154915Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:266bb57dd95b5cdabe341c15f708722dc06233ca416448a1b78527d36cb21937","observation_id":"dfc28f73-cd26-4e11-8821-764ed591bb90","resolution":{"observed_at":"2026-08-06T20:42:32.154915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.267478Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.267478Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b941a2d8bdde7aca4b4df915ecf6060ed93442c54b8f855fa38bb75304a877ad","observation_id":"5e941aee-f4b8-40f0-af13-b00b557fdda8","resolution":{"observed_at":"2026-08-06T20:42:32.267478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.365436Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.365436Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2a085e231a3e01652294971a7c52b03e0e4b1d0bcd2a12beddcbb0599d2c4ac8","observation_id":"01061b29-a12e-47d4-8d7f-cd20eff5e3f2","resolution":{"observed_at":"2026-08-06T20:42:32.365436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.496355Z","title":"Implicit generation and modeling with energy based models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.496355Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:dd5ad324620a3b6cb01f312b8c4314845ae13273050acc2d2d5549d29fbc49c2","observation_id":"82ed70fd-9e40-4087-9165-04cf1f67916c","resolution":{"observed_at":"2026-08-06T20:42:32.496355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.01316","last_updated":"2021-06-11T00:41:30Z","snapshot_observed_at":"2026-08-07T22:15:24.499246Z","submitted_at":"2020-12-02T16:39:49Z","title":"Improved Contrastive Divergence Training of Energy Based Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.01316","snapshot_observed_at":"2026-08-06T20:42:32.583167Z","title":"Improved contrastive divergence training of energy based models","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.583167Z"},"links":{"cited_paper":"/paper/2012.01316","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7f1a7ee82d183c3d048c7d483e0f5d8b6fa33233e380051067c0f35d7cb6f6c8","observation_id":"4b3b9699-2254-443f-ac51-421dff239c63","resolution":{"observed_at":"2026-08-06T20:42:32.583167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.661452Z","title":"Learning energy-based models in high-dimensional spaces with multiscale denoising-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.661452Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3b6dabac132324193910fb12bf6d03f3395ebe341140bd2a9e05cc5e6139b4da","observation_id":"15b6c26c-96b6-4add-acec-1a57e546c871","resolution":{"observed_at":"2026-08-06T20:42:32.661452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05033","last_updated":"2021-12-21T12:02:53Z","snapshot_observed_at":"2026-08-08T03:38:54.432757Z","submitted_at":"2020-03-10T23:22:09Z","title":"Generalized Energy Based Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05033","snapshot_observed_at":"2026-08-06T20:42:32.751974Z","title":"Generalized energy based models","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.751974Z"},"links":{"cited_paper":"/paper/2003.05033","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:c4f65189ab2a7df620e9137056ca40f9c2e7c53f4162c99b5955a5dcdd3a3930","observation_id":"7577563f-dd4a-42cc-8148-af4765d2dc87","resolution":{"observed_at":"2026-08-06T20:42:32.751974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.794687Z","title":"Improving language understand- ing by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.794687Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e60c6dcd3536b65d4e4868a0c8b36cf86ed84f9dd821e9ae771f444a8a573165","observation_id":"b1389608-cc49-44b6-b5a4-6fe468f769e3","resolution":{"observed_at":"2026-08-06T20:42:32.794687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.928649Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.928649Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6c27575cf9828d9ca4c9ee4789c27571f749f8b22a05f302f1ee58577764fbb4","observation_id":"77a76a90-740e-492b-9e49-fe3a790f85f7","resolution":{"observed_at":"2026-08-06T20:42:32.928649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.044276Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.044276Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:90ad994c1b7ea5c8e3ae4c5ea1cae1f08dd1a59ababc13fc16205c43a5825159","observation_id":"94a2c2a7-26b1-490b-bafc-21467542ba55","resolution":{"observed_at":"2026-08-06T20:42:33.044276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.161433Z","title":"The complexity of theorem-proving procedures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.161433Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7fc0f3f28e7455fd21160a492c9051c647b224388bf8c91d0c85ecbad896d864","observation_id":"8a140042-017d-4db9-b43b-16e9a5e2ce6c","resolution":{"observed_at":"2026-08-06T20:42:33.161433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.267588Z","title":"The knowledge complexity of interactive proof- systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.267588Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:df86e925d86cc5c94002986e545c65617cbff2027536ac12fc4c21f97513f618","observation_id":"f4b287c5-52a4-4de1-9cad-33c7eef7879b","resolution":{"observed_at":"2026-08-06T20:42:33.267588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.352645Z","title":"Letter to john von neumann, 1956","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.352645Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:09534208551159ca969b2e793f69cc15c9baf48efa6e0acb7abcc8917ef3d3d2","observation_id":"559112c5-f05d-4e44-9241-67463eaf949b","resolution":{"observed_at":"2026-08-06T20:42:33.352645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00243","last_updated":"2026-04-10T18:51:54Z","snapshot_observed_at":"2026-07-06T18:55:19.894571Z","submitted_at":"2024-08-01T02:47:30Z","title":"A Survey on the Applications of Zero-Knowledge Proofs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00243","snapshot_observed_at":"2026-08-06T20:42:33.473880Z","title":"A survey on the applications of zero-knowledge proofs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.473880Z"},"links":{"cited_paper":"/paper/2408.00243","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:f7773f7cbfac27c0538389310b53e1c7a4a4e22769588eb1a5abdd35d19e6e4c","observation_id":"ec6ed2f9-1d88-4dca-b12f-2be3541a6827","resolution":{"observed_at":"2026-08-06T20:42:33.473880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.535547Z","title":"A method for obtaining digital signatures and public-key cryptosystems","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.535547Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8af7b078a5ea17c0674b97eb0eb86f20f6ef13b1611866b8b9c669da68b613d3","observation_id":"20a593dc-e042-46ba-9627-a8cc5bd34d53","resolution":{"observed_at":"2026-08-06T20:42:33.535547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.625155Z","title":"Alphacode 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.625155Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d2228f746f3b7d40bba58d146dbfd79136ef8cd26d7b9570b0a4f6d180df076f","observation_id":"7f0e8c6f-3b52-422a-abf5-a0c656e829de","resolution":{"observed_at":"2026-08-06T20:42:33.625155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.707498Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.707498Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b6658fe3e44bffe44b384104637996d9d7217d7c224df82fcc4c508f77ebd8d1","observation_id":"768dd99b-21e3-4e3f-9aba-2ab20f6bb9bb","resolution":{"observed_at":"2026-08-06T20:42:33.707498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.786601Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.786601Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2d47136523e3c0b71c8be52fc97412bde9d33528ad8b9ae41a79118ce1d037a7","observation_id":"afb0c69a-d33c-413b-a078-1cf757642dc8","resolution":{"observed_at":"2026-08-06T20:42:33.786601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.870075Z","title":"All roads lead to likelihood: The value of reinforcement learning in fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.870075Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:006db05f35de5c951883bac076fe38700d42c86d14b921a60aa9fb9d866541ba","observation_id":"46e69b7b-8bbf-4172-a7ed-782d24f6ef67","resolution":{"observed_at":"2026-08-06T20:42:33.870075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11179","last_updated":"2024-06-17T03:36:47Z","snapshot_observed_at":"2026-07-06T18:31:53.591578Z","submitted_at":"2024-06-17T03:36:47Z","title":"Learning Iterative Reasoning through Energy Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11179","snapshot_observed_at":"2026-08-06T20:42:34.008179Z","title":"Learning iterative reasoning through energy diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.008179Z"},"links":{"cited_paper":"/paper/2406.11179","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:db55657c3601d52708e6312e6cef2ed613200324975f415c222368a777cf961e","observation_id":"11ab7f4d-b8a6-4e9b-9698-8b875689a168","resolution":{"observed_at":"2026-08-06T20:42:34.008179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00059","last_updated":"2023-10-31T18:07:07Z","snapshot_observed_at":"2026-07-06T16:41:19.189036Z","submitted_at":"2023-10-31T18:07:07Z","title":"The Generative AI Paradox: \"What It Can Create, It May Not Understand\"","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00059","snapshot_observed_at":"2026-08-06T20:42:34.086763Z","title":"what it can create, it may not understand","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.086763Z"},"links":{"cited_paper":"/paper/2311.00059","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:00fd5fd488a346659ddfb968e7a50f3b13a61886294bbd38e604e0e1c29c39fe","observation_id":"a061f6be-ffe3-4212-853d-8101b4619921","resolution":{"observed_at":"2026-08-06T20:42:34.086763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.184331Z","title":"Commonsense psychology in human infants and machines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.184331Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:00c81863037a0f07627ee6ff3ab41c7f65e954c6851daeb853dbbd95f723477b","observation_id":"c38fb9d3-72a9-4066-a8db-c2eac63a55d4","resolution":{"observed_at":"2026-08-06T20:42:34.184331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.264398Z","title":"Position: Llms can’t plan, but can help planning in llm-modulo frameworks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.264398Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a5267722a251781ccbeea0687889e5baf26330d8cae2bed81210756e04d08070","observation_id":"1e07140c-3c4c-4dc8-a8ad-d2acaf5468c8","resolution":{"observed_at":"2026-08-06T20:42:34.264398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01384","last_updated":"2023-02-02T19:41:00Z","snapshot_observed_at":"2026-08-07T09:28:50.007705Z","submitted_at":"2023-02-02T19:41:00Z","title":"Energy-Inspired Self-Supervised Pretraining for Vision Models","version":1},"cited_work":{"arxiv_id":"2302.01384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.01384","snapshot_observed_at":"2026-08-06T20:42:42.653873Z","title":"Energy-Inspired Self-Supervised Pretraining for Vision Models","venue":"cs.CV","work_id":"cca721c0-8349-4375-a78f-2a1c79fa931f","year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.353007Z"},"links":{"cited_paper":"/paper/2302.01384","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:dd0d1cbcdde73f39e39e4e43f88400ca5909c657ac68463187e9abd5a3e31f28","observation_id":"b022da06-296c-49f9-94e6-013c213d0a80","resolution":{"observed_at":"2026-08-06T20:42:42.701929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.452087Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.452087Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:58087a6301b64461d87ad35deaac28e7e3528ccb13106c81769a1d213aabcc5f","observation_id":"414175cf-2b52-49e4-abf4-bc886fb2473a","resolution":{"observed_at":"2026-08-06T20:42:34.452087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.562610Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.562610Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b1ef9e972434110f242f5424b3b17fb4f9951af89a865b4583ebd2c431881307","observation_id":"873a1416-b6da-4ca0-8d9f-6812393ddf3b","resolution":{"observed_at":"2026-08-06T20:42:34.562610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.631041Z","title":"A neural probabilistic language model","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.631041Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:96287f84e545e0d9f404d49b2520c8b95f26c3a5c98d7f9be382ff4aaf1096b8","observation_id":"7c53a24a-7410-4b4c-a398-ba3ff1db27fd","resolution":{"observed_at":"2026-08-06T20:42:34.631041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.700666Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.700666Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ea9899ac37d8fbd165c4f78e5d04d1a548eb0edf24d1ffacb52ac07d09c754f4","observation_id":"d8ae396b-51c6-4911-aee0-fc24d70c1975","resolution":{"observed_at":"2026-08-06T20:42:34.700666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.765629Z","title":"How to compute hessian-vector products? In ICLR Blogposts 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.765629Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d07c1edd578dadf05cf30c67dfab66d6e18ab8387138e971c2b17d2e22926cd9","observation_id":"075ae49c-bc82-40d2-90e3-2ce23ff9aa47","resolution":{"observed_at":"2026-08-06T20:42:34.765629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.828094Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.828094Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:92b76da7d04d01fae608b50e505da79d287a1695c1215cf23da59e38ef0a4a59","observation_id":"02f05fed-2e8d-4210-a785-c4f7d5cd3a88","resolution":{"observed_at":"2026-08-06T20:42:34.828094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.925762Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.925762Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e76e6b038b8ed18affd293ec9f813db32c2080b171247807f427884edc77a430","observation_id":"ef35ec80-1bb7-4aba-b311-f561852563ce","resolution":{"observed_at":"2026-08-06T20:42:34.925762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.006584Z","title":"Dinov2: Learning robust visual features without supervision, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.006584Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8a6e8c101264b005a905d1ec2aa7e07f1484323b2270b71a8a414f26ea1fa3fb","observation_id":"a0d5cbff-3fec-4dde-98b2-90c2b92dc950","resolution":{"observed_at":"2026-08-06T20:42:35.006584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.067979Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.067979Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ddeb36257e8bab85d4dcd7af0af9750d25a822bbb8b779468a86b32e2bcb8aab","observation_id":"36237a5c-f279-41d2-a05d-8b09e6fe5502","resolution":{"observed_at":"2026-08-06T20:42:35.067979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.135957Z","title":"Audiolm: a language modeling approach to audio generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.135957Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ab75e6eacbcb9fdcdfba7b5b29ea2130a80dc7b484350c17bdf592660464a5bf","observation_id":"b223fe79-471e-44cd-8389-c8526b5b20c6","resolution":{"observed_at":"2026-08-06T20:42:35.135957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.207395Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.207395Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:282e8b7f4056e1fac163cdbe1ca5c5eb064608bc220cba32bd70d6b094217ebd","observation_id":"4c13c89c-f5e6-4ca9-9f60-e058e0961c63","resolution":{"observed_at":"2026-08-06T20:42:35.207395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.251527Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.251527Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:465a75885e38b0dae84ddcefe4b82f877591b9cf4fc5c57e90e35bdca61f6963","observation_id":"0575370b-3e6d-45ec-b482-68c5e7ffcab4","resolution":{"observed_at":"2026-08-06T20:42:35.251527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:42:35.319402Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.319402Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b9133feab59f55830d66c9005a082e66d801e8811fb12a857df48d973a4da717","observation_id":"4a473687-5d2e-424b-a2b3-9fd18ce432ce","resolution":{"observed_at":"2026-08-06T20:42:35.319402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:42:35.450884Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.450884Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d021542f38b9e4111d7fb42596573a71fe7711e1ef410757c5278db6b807a5bc","observation_id":"8c235005-e7d1-493f-9a44-56e12789270f","resolution":{"observed_at":"2026-08-06T20:42:35.450884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18969","last_updated":"2025-02-26T09:27:54Z","snapshot_observed_at":"2026-08-07T17:47:37.655016Z","submitted_at":"2025-02-26T09:27:54Z","title":"(Mis)Fitting: A Survey of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18969","snapshot_observed_at":"2026-08-06T20:42:35.541466Z","title":"(mis) fitting: A survey of scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.541466Z"},"links":{"cited_paper":"/paper/2502.18969","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5d59b0d4ef59e06d289bf2201fac9d4b854848520acfaf0ff654f726d01d39aa","observation_id":"3d490c07-6995-4848-8e3e-07d52a97d696","resolution":{"observed_at":"2026-08-06T20:42:35.541466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.606202Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.606202Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:892504d235d0d8d3a26b566a39752cc46f14cc97ec8cb26bf911d0157c2a9f87","observation_id":"239be76b-5a53-40d2-92a1-62534bbfc5b4","resolution":{"observed_at":"2026-08-06T20:42:35.606202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.695173Z","title":"Revisiting neural scaling laws in language and vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.695173Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:91d07fffe8c4aa18382ae55eda13be4c4e31a73f84d6dc22d00f091089a3e164","observation_id":"55a62e46-f355-405c-b337-7eb717f98f76","resolution":{"observed_at":"2026-08-06T20:42:35.695173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T20:42:35.778302Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.778302Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:51ab027b0ec7ddb9feacdc18599eb8da86867c46959182cb955e84885019db3f","observation_id":"0cc151af-d309-43ac-91eb-0371b3636c69","resolution":{"observed_at":"2026-08-06T20:42:35.778302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T20:42:35.885430Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.885430Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:f233357613f04013fc04aaa4a4728becb78723e1ba64260907e213ca338c4975","observation_id":"f764aa79-0c37-43ea-8bca-35bc22ce5393","resolution":{"observed_at":"2026-08-06T20:42:35.885430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.973122Z","title":"Neural ordinary differential equations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.973122Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:c5a8edf6632a528540b69c1d53a410ec07bea7027f35de4b9a1280d8a747dbd9","observation_id":"3ef06e2f-f89e-43ab-a067-790e7c3b817e","resolution":{"observed_at":"2026-08-06T20:42:35.973122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.040930Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.040930Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6ae633f7d0cdd1252f084e729a7906656e0f6c9cfbc85b8706f2d233ef99d836","observation_id":"a740d04b-eb70-44c9-9aeb-7252390f443c","resolution":{"observed_at":"2026-08-06T20:42:36.040930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.083704Z","title":"Redpajama: an open dataset for training large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.083704Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:272bb4099706027c22cd42d847c497307e7249caf8a6096a7d8a6272e296baea","observation_id":"00ecd7a6-48b4-44a1-bfe2-1a9d36cd77c4","resolution":{"observed_at":"2026-08-06T20:42:36.083704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-06T20:42:36.122729Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.122729Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:188ceaadadb03dd4fae9115c52bd7f850a6f813f82a62c7ab0f3150dcc4a84d9","observation_id":"03016366-1bbf-4b52-b732-77cf3b51bbc6","resolution":{"observed_at":"2026-08-06T20:42:36.122729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-06T20:42:36.203029Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.203029Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:0732022567f100680afb8bb8f1083038f7cb5c7bc0a379f9a94ff0923980a770","observation_id":"24d925d3-d603-4cfd-a18a-e9945c9595e2","resolution":{"observed_at":"2026-08-06T20:42:36.203029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.279692Z","title":"Physics of language models: Part 2.1, grade- school math and the hidden reasoning process","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.279692Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:aa67c691f2b9edf0a157bbc7c4036295a3ac9fb0c73aca4bcb8db8d348c6be9a","observation_id":"3688ee12-d42c-401c-9711-c7b05e16bae3","resolution":{"observed_at":"2026-08-06T20:42:36.279692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T20:42:36.404415Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.404415Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:469e1aa74c026d7bc30c6950ad9a03fa219c908735da2bee32dfc30143830226","observation_id":"4b39c09f-3a08-4864-8434-65d1f3ef63f7","resolution":{"observed_at":"2026-08-06T20:42:36.404415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-06T20:42:36.467847Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.467847Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a76a19592fec4c5d1ba152ef1ff2d47f6626a484ac987acc1eda9e81e4eccf65","observation_id":"598cefe2-918e-4e00-920a-e1dd5610ae53","resolution":{"observed_at":"2026-08-06T20:42:36.467847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T20:42:36.518813Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.518813Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6f7653a0c5b061449a23b53fbf6b62f8dde5c5fbd902775d1d94ba5f35e8a009","observation_id":"7ebfd7ff-96a9-4f0e-b35c-d731d3037fb5","resolution":{"observed_at":"2026-08-06T20:42:36.518813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.609859Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36:55565–55581, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.609859Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a1e0e7b3bf432b14c30d2f24475b27479eb4c436d80e72f3cc28bccd6ccd9dc2","observation_id":"4f7b2363-e926-404f-8547-9cad4022b36f","resolution":{"observed_at":"2026-08-06T20:42:36.609859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T04:36:50.019846Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":162},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 162 outbound references and 16 inbound Pith citation observations for arXiv:2507.02092."}