{"as_of":"2026-08-10T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9654fd655cd238b7c908ebfa56376900c6d71492ac92d52096a1c1b69dcd386","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:28:52.279862Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:01:15.054309Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T20:05:04.830513Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":"2502.04375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis for reasoning bias of language models with small initialization","venue":null,"work_id":"415f9cae-8f7f-4cb8-9d9c-37a89f4fc1bf","year":null},"citing_paper":{"arxiv_id":"2504.09484","last_updated":"2026-04-12T13:30:14Z","snapshot_observed_at":"2026-07-06T21:08:33.353144Z","submitted_at":"2025-04-13T08:50:24Z","title":"An overview of condensation phenomenon in deep learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T20:02:41.105786Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2504.09484"},"observation_digest":"sha256:1857ce61d8fc5eaa9e9439a5b95536c1365eb3bf9fd91415e9e2e2be542aef3d","observation_id":"66fefe0f-4f93-47e8-9afe-9276c46157ab","resolution":{"observed_at":"2026-05-22T20:05:04.833173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-08-07T13:01:15.054309Z","title":"An analysis for reasoning bias of language models with small initialization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23013","last_updated":"2025-05-29T02:42:20Z","snapshot_observed_at":"2026-08-08T06:33:23.795716Z","submitted_at":"2025-05-29T02:42:20Z","title":"Scalable Complexity Control Facilitates Reasoning Ability of LLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:15.054309Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2505.23013"},"observation_digest":"sha256:38d704497e224bb03a517a9460cbf2262b646cc36b5dc6f67856ec212bc7c07f","observation_id":"b8fc0767-8d84-497a-abfa-5756056ee175","resolution":{"observed_at":"2026-08-07T13:01:15.054309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-08-04T13:54:18.723775Z","title":"An analysis for reasoning bias of language models with small initialization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.24653","last_updated":"2026-07-13T03:51:39Z","snapshot_observed_at":"2026-08-09T06:52:58.188256Z","submitted_at":"2025-09-29T12:02:05Z","title":"Unveiling the Mechanisms of Multi-Hop Reasoning in Transformers via Identity Bridge","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:18.723775Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2509.24653"},"observation_digest":"sha256:bc272b202b79a5d3f870561e2d1f4d867ee9cf756be7ad1a24fb481080cb40d6","observation_id":"6ec5b63b-4bbc-4e57-864d-1447d941c7f6","resolution":{"observed_at":"2026-08-04T13:54:18.723775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":"2502.04375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis for reasoning bias of language models with small initialization","venue":null,"work_id":"415f9cae-8f7f-4cb8-9d9c-37a89f4fc1bf","year":null},"citing_paper":{"arxiv_id":"2601.19208","last_updated":"2026-05-12T21:37:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-27T05:22:34Z","title":"How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T11:20:33.400885Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2601.19208"},"observation_digest":"sha256:514a230c083f95827d6285d007d101ae93b634b97b96b644f50965c9ae447adc","observation_id":"a616f226-79c2-4b59-a397-8de0f7fbb763","resolution":{"observed_at":"2026-05-16T11:20:52.679420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":"2502.04375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis for reasoning bias of language models with small initialization","venue":null,"work_id":"415f9cae-8f7f-4cb8-9d9c-37a89f4fc1bf","year":null},"citing_paper":{"arxiv_id":"2603.01097","last_updated":"2026-07-29T13:53:39Z","snapshot_observed_at":"2026-08-02T19:49:42.383713Z","submitted_at":"2026-03-01T13:28:57Z","title":"Understanding LoRA as Knowledge Memory: An Empirical Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:54.899039Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2603.01097"},"observation_digest":"sha256:b8c2edf510af4782abea7fb43a53ea2b848768c037927286d3dab8e71dd416c3","observation_id":"1c17a3da-46b0-4515-aaf6-d2123e7139f9","resolution":{"observed_at":"2026-05-15T18:10:13.250276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04375","snapshot_observed_at":"2026-08-02T19:49:44.634914Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01097","last_updated":"2026-07-29T13:53:39Z","snapshot_observed_at":"2026-08-02T19:49:42.383713Z","submitted_at":"2026-03-01T13:28:57Z","title":"Understanding LoRA as Knowledge Memory: An Empirical Analysis","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:49:44.634914Z"},"links":{"cited_paper":"/paper/2502.04375","citing_paper":"/paper/2603.01097"},"observation_digest":"sha256:df23f0e8221ba9110f3939b2db7bedbdee337ec01e92c8418ce4ab57dd279364","observation_id":"978df83f-d197-48a9-84d2-e4b6899c320e","resolution":{"observed_at":"2026-08-02T19:49:44.634914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04375/citation-record","integrity":"/paper/2502.04375/integrity","json":"/paper/2502.04375/citation-record.json","paper":"/paper/2502.04375"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-09T05:28:51.220951Z","title":"J., Javaheripi, M., Kauffmann, P., Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.220951Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:4a95289bca6e0d0fa5ae5f4371d317b5776f81ee4d9d3ba835a27bf8a48a4cf0","observation_id":"e863a94a-9e15-4fd7-a0af-a7c4fd290b6a","resolution":{"observed_at":"2026-08-09T05:28:51.220951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T05:28:51.227174Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.227174Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:3766a87ec44840c9bd4cd26af1aa3e22caa36605f440d99d6c026be1172437a1","observation_id":"572a90c5-ba55-436e-9ae3-e26e705ce555","resolution":{"observed_at":"2026-08-09T05:28:51.227174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.661636Z","title":"S., Hu, W., Li, Z., Salakhutdinov, R","venue":null,"work_id":"560fd4af-0861-4265-8c61-e9a50c24f4da","year":2019},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.232212Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:12de735014e6f124e82d534b75d7db1777981a11abf787be5f32da71bd3a6fa4","observation_id":"7612f387-27eb-47fa-9cf5-e1ead065d700","resolution":{"observed_at":"2026-08-09T05:28:53.666924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.577161Z","title":"Reflections after refereeing papers for nips","venue":null,"work_id":"fa666eaa-0672-4f7c-b608-51ec1eb68793","year":1995},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.236969Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:b12d690100cd7e3f7116e2dddc5d1640064edbb2bc6e7e5165b795fe38077432","observation_id":"bb436b54-89ab-415d-bcfc-f53260046733","resolution":{"observed_at":"2026-08-09T05:28:53.616478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.490902Z","title":"and Rathie, P","venue":null,"work_id":"c6fa1cee-3c81-4f43-837b-f5e5fff63536","year":2007},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.241569Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:0bc62e3352fe759117bdcdd665bc580867b5d8be3e8a7bd79bf4eeacd08e8506","observation_id":"01915d98-d04e-4ebe-9319-62ae92630134","resolution":{"observed_at":"2026-08-09T05:28:53.525810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4208/csiam-am.so-2023-0016","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"CSIAM Transactions on Applied Mathematics","work_id":"aece2e87-111d-4a09-b6d0-43ff2c3db062","year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.246643Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:da6c3aa628970d31d3a40bfb7777b4ad5427cc5f2e69c72ea1080590cc5bbd08","observation_id":"7280dc0a-53e8-4036-8f73-99b8c833acf1","resolution":{"observed_at":"2026-08-09T05:28:52.349960Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.444528Z","title":"and Bach, F","venue":null,"work_id":"01bde051-c855-40be-bb75-9937c3a8aa64","year":2018},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.252040Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:187eed90eadb0ac71e4e5e8286dbc5b81bbb33f1d01a213fc283e13c9c72b9dd","observation_id":"0d67c68a-3e61-4241-829f-9a3692893d1b","resolution":{"observed_at":"2026-08-09T05:28:53.464356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.14271","last_updated":"2022-08-30T13:44:41Z","snapshot_observed_at":"2026-08-02T22:53:15.092443Z","submitted_at":"2022-08-30T13:44:41Z","title":"Faithful Reasoning Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.14271","snapshot_observed_at":"2026-08-09T05:28:51.257146Z","title":"and Shanahan, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.257146Z"},"links":{"cited_paper":"/paper/2208.14271","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:dfe05474c432228336da8f32420989a1422dbcabff52ffe4f5691593349ad60f","observation_id":"2ed755b8-7569-4ff0-89d1-601a80a9f9b5","resolution":{"observed_at":"2026-08-09T05:28:51.257146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09712","last_updated":"2022-05-19T17:25:28Z","snapshot_observed_at":"2026-08-09T16:09:57.851750Z","submitted_at":"2022-05-19T17:25:28Z","title":"Selection-Inference: Exploiting Large Language Models for Interpretable Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09712","snapshot_observed_at":"2026-08-09T05:28:51.262280Z","title":"Selection-inference: Exploiting large language models for interpretable logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.262280Z"},"links":{"cited_paper":"/paper/2205.09712","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:cd02cf030fedef378a5ed159a591ebc95a3f5644958c70dce5d98cd0bdd52f9e","observation_id":"54507407-694a-4d15-9c72-0177863cc7de","resolution":{"observed_at":"2026-08-09T05:28:51.262280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07732","last_updated":"2022-05-05T10:01:16Z","snapshot_observed_at":"2026-07-06T11:58:05.082302Z","submitted_at":"2021-10-14T21:24:27Z","title":"The Neural Data Router: Adaptive Control Flow in Transformers Improves Systematic Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07732","snapshot_observed_at":"2026-08-09T05:28:51.278903Z","title":"The neural data router: Adaptive control flow in transformers improves systematic generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.278903Z"},"links":{"cited_paper":"/paper/2110.07732","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:5d8a4c6a53ce1c626e6547be2d1057ee900f82a404decce17d7026cd87a87e2b","observation_id":"ece0bfbf-5f29-4af2-8523-40b8fc116d48","resolution":{"observed_at":"2026-08-09T05:28:51.278903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06350","last_updated":"2022-10-12T16:01:57Z","snapshot_observed_at":"2026-07-06T14:04:16.634759Z","submitted_at":"2022-10-12T16:01:57Z","title":"CTL++: Evaluating Generalization on Never-Seen Compositional Patterns of Known Functions, and Compatibility of Neural Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06350","snapshot_observed_at":"2026-08-09T05:28:51.310278Z","title":"Ctl++: Evaluating generalization on never-seen compositional patterns of known functions, and compatibility of neural representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.310278Z"},"links":{"cited_paper":"/paper/2210.06350","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:e3dee582f5846554668958b5cbd5e2757b9443453ad1d89bc14e201f256e4d39","observation_id":"36299e03-8cb4-4498-8d23-30005147fb43","resolution":{"observed_at":"2026-08-09T05:28:51.310278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.343200Z","title":"L., Jiang, L., Lin, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.343200Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:8d07f0b58af6753a8939207cab386184cdc877bb3cb0b3d82a06a9db65bf0b65","observation_id":"8344b049-1e7f-4a95-9e9d-78aca8964860","resolution":{"observed_at":"2026-08-09T05:28:51.343200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.417095Z","title":"A comparative analysis of optimization and generalization properties of two-layer neural network and random feature models under gradient descent dynamics","venue":null,"work_id":"dae2a487-0b8e-4a75-b3b6-cba2e820e357","year":2020},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.375582Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:fc7c18fcc5502480aa8355084a0d032629c7a7d6754157eacbdd2d0876fcc33f","observation_id":"5c83dc4b-a778-4551-9439-c7bc29679656","resolution":{"observed_at":"2026-08-09T05:28:53.422368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-09T05:28:51.403494Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.403494Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:95bc166e37a4866931da2a8310b105b49612d6dbaca9010daf3ab361f7bfdf13","observation_id":"73bb8b33-8326-404f-a4e5-7a52f025a538","resolution":{"observed_at":"2026-08-09T05:28:51.403494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.401032Z","title":"How does gpt obtain its ability? tracing emergent abilities of language models to their sources","venue":null,"work_id":"a555f939-8154-426f-b943-d5f2bcd05e19","year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.442629Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:b593e6b36dee340a71e6ff34001081762af5ba41e7df5a3d24d7b1d7f1f0140b","observation_id":"f571c1fe-67d4-478d-84f4-639840cf1a11","resolution":{"observed_at":"2026-08-09T05:28:53.406308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.501648Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.501648Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:8e20917985c486a8c0fe6422acdfc8811f27acd67029991321ccc00b297f4777","observation_id":"671aca84-d7a9-4b9b-b25c-0c7a3538cda2","resolution":{"observed_at":"2026-08-09T05:28:51.501648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.373987Z","title":"S., Perez, F., Ba, J., and Volkovs, M","venue":null,"work_id":"a475aa2d-50c4-4001-8217-fa6bc4bdef5b","year":2020},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.547458Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:de9f8542e93bc929ee8405bd5f2b78a00727fd623a8f6c5866d70afeb684ac45","observation_id":"bce18684-9761-4eff-b1b7-d8fc826d7f09","resolution":{"observed_at":"2026-08-09T05:28:53.379227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09657","last_updated":"2019-07-05T12:41:30Z","snapshot_observed_at":"2026-08-01T16:35:42.239449Z","submitted_at":"2018-05-20T10:33:00Z","title":"Learning compositionally through attentive guidance","version":4},"cited_work":{"arxiv_id":"1805.09657","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.09657","snapshot_observed_at":"2026-08-09T05:28:52.740674Z","title":"Learning compositionally through attentive guidance","venue":"cs.CL","work_id":"996ea81c-6357-4814-8120-b35c26fb87ed","year":2018},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.552290Z"},"links":{"cited_paper":"/paper/1805.09657","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:a0a2aad4672b57caacb1fe85faf2292d1b0e73e126f45792d4c38ae44ff0dd7d","observation_id":"eefeb4ba-6f10-4d26-85c3-dcebc66f833d","resolution":{"observed_at":"2026-08-09T05:28:52.745846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.358107Z","title":"Neural Tangent Kernel : Convergence and Generalization in Neural Networks","venue":null,"work_id":"11712ec8-2528-4f74-acab-1accd7a48527","year":2018},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.557359Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:1ea8f5564e429c05e0745399b4945f83ab7fff9d74a7776c8cd08d138c9fe82b","observation_id":"0fa9d1e1-9024-4aa2-bee3-4c2504ddd66c","resolution":{"observed_at":"2026-08-09T05:28:53.363554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.562035Z","title":"B., and M \\\"u ller, K","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.562035Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:8a6d9f34b08bae5259f5adbbc02f070e12041d46438682f21d29d62de18334ce","observation_id":"718e5914-bfe6-4e6b-88e0-52a57fd03c0d","resolution":{"observed_at":"2026-08-09T05:28:51.562035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10884","last_updated":"2023-11-06T19:25:02Z","snapshot_observed_at":"2026-07-06T14:44:41.780270Z","submitted_at":"2023-01-26T00:53:11Z","title":"Break It Down: Evidence for Structural Compositionality in Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10884","snapshot_observed_at":"2026-08-09T05:28:51.566749Z","title":"A., Serre, T., and Pavlick, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.566749Z"},"links":{"cited_paper":"/paper/2301.10884","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:487f5c250d2d34621b5ce6f8f0be41a69a2ce1a7f57fdcdcbb752458b71c67db","observation_id":"d68ae65b-4b0e-4cc9-9b77-c09de6140f3c","resolution":{"observed_at":"2026-08-09T05:28:51.566749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.571389Z","title":"Not all tokens are what you need for pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.571389Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:27a65784640042bc28d18b67483891dedd17a9f973f5255526043939b35562ab","observation_id":"f9f4ffcc-a086-4b30-9e69-316ee80546cf","resolution":{"observed_at":"2026-08-09T05:28:51.571389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-09T05:28:51.575637Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.575637Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:29618e7220e0227e8841f70d71d707ac4fd477be201a4d4b91be0dd5f8a196c0","observation_id":"7d20637e-1d00-4009-a74c-95afaac33a48","resolution":{"observed_at":"2026-08-09T05:28:51.575637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-05T14:55:09.743440Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-09T05:28:51.580568Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.580568Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:d335a4ad6648def8543d71435fe2182f1ffd6cfc95e5fff3d6d30baeeca50ca1","observation_id":"276bfca0-e664-4254-95a6-d80ad59018ca","resolution":{"observed_at":"2026-08-09T05:28:51.580568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08249","last_updated":"2023-10-01T18:34:20Z","snapshot_observed_at":"2026-08-07T23:54:19.429300Z","submitted_at":"2020-04-17T13:59:07Z","title":"Understanding the Difficulty of Training Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08249","snapshot_observed_at":"2026-08-09T05:28:51.585595Z","title":"Understanding the difficulty of training transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.585595Z"},"links":{"cited_paper":"/paper/2004.08249","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:d3ddecc3f0cddbffa823a5daaf50907f7f4f4bc4e4c5e671a7c678259cf7bdf1","observation_id":"a35bad4b-12e6-4bb5-9f02-49f411c4d22c","resolution":{"observed_at":"2026-08-09T05:28:51.585595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.315270Z","title":"J., Ma, Z., and Zhang, Y","venue":null,"work_id":"944d3f5d-88a6-4330-8ade-137a84cc981c","year":2021},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.589800Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:465753bd2ee9cd27c36b0f9b6d8c823bb12ef55ab52bf083bc506d9da9b08b43","observation_id":"17c8b97d-acaf-48b7-b6b2-195ea4becdf4","resolution":{"observed_at":"2026-08-09T05:28:53.319975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.594177Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.594177Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:985cfa96e6eb7e16da7c4235145877fef0c5bece1b5f1e7ae5bad5b5418175f9","observation_id":"c396f774-5388-4fc7-85ab-05341015456f","resolution":{"observed_at":"2026-08-09T05:28:51.594177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.598613Z","title":"A mean field view of the landscape of two-layer neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.598613Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:83d71e35a4d1e93f664b9e7570a74bf891f158cc5937e733e281a0061895da5b","observation_id":"318fdf09-8ad9-422b-8499-08325e10cf91","resolution":{"observed_at":"2026-08-09T05:28:51.598613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09336","last_updated":"2025-07-25T21:42:43Z","snapshot_observed_at":"2026-08-07T04:10:49.606943Z","submitted_at":"2023-10-13T18:00:59Z","title":"Compositional Abilities Emerge Multiplicatively: Exploring Diffusion Models on a Synthetic Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09336","snapshot_observed_at":"2026-08-09T05:28:51.603410Z","title":"S., Dick, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.603410Z"},"links":{"cited_paper":"/paper/2310.09336","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:42b2a79dd138e4dcb9d2a4db1375074f136257e22ce94ba0f326fefa9f8244ef","observation_id":"e96eff98-44a6-4c7b-af36-3131d9171e0c","resolution":{"observed_at":"2026-08-09T05:28:51.603410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.620847Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.620847Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:1757cb89698010cae74b73e01f2ff64892d7f37187db761bf9b2c0eb6b81edfe","observation_id":"18875ebd-5a96-486f-883c-61a8d0949742","resolution":{"observed_at":"2026-08-09T05:28:51.620847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12997","last_updated":"2024-02-05T23:29:12Z","snapshot_observed_at":"2026-08-09T10:43:24.211063Z","submitted_at":"2023-11-21T21:16:54Z","title":"Compositional Capabilities of Autoregressive Transformers: A Study on Synthetic, Interpretable Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12997","snapshot_observed_at":"2026-08-09T05:28:51.641065Z","title":"P., Tanaka, H., and Lubana, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.641065Z"},"links":{"cited_paper":"/paper/2311.12997","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:1686be201bc7ed4020ec803de901c7c0a40f3cbd2493e11039d49fee1cb0fb90","observation_id":"857d318c-56eb-4190-b762-acc542225018","resolution":{"observed_at":"2026-08-09T05:28:51.641065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.279990Z","title":"and Vanden-Eijnden, E","venue":null,"work_id":"26db6b38-c0bc-42ae-8ba6-a8755c5af431","year":2018},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.700823Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:bbdfe74b19a3126218f6f271c9856d69c8352f6f6d81805a47d927e7350c6055","observation_id":"e81b832a-d782-4d54-97f1-9355dea9d994","resolution":{"observed_at":"2026-08-09T05:28:53.285195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.265125Z","title":"and He, H","venue":null,"work_id":"41635c74-f12f-42d9-89ed-c83f8e068c83","year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.738043Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:0e6d1219e5076584660a7913033ce79cc8e5bb42d1563fbbb49fb08eb829b53b","observation_id":"82d661f1-f854-4d06-8bfb-bd376c14dbac","resolution":{"observed_at":"2026-08-09T05:28:53.269539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:51.757701Z","title":"and Spiliopoulos, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.757701Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:5aa5a22045802f11b7944255f7329f1d74fd52bf6c4071deacf12e32486a6ae6","observation_id":"485a5d23-6b5d-4d98-8247-abf04b726b2d","resolution":{"observed_at":"2026-08-09T05:28:51.757701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.250117Z","title":"Neurocompositional computing: From the central paradox of cognition to a new generation of ai systems","venue":null,"work_id":"26d2c7b7-d427-4c53-be03-9f45b6bf1bda","year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.784618Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:5aef3a22811d0797163609fdd5742eadc1862810502b4ee53a060cad8c1531a0","observation_id":"6756689a-d32d-49bd-9937-a4f787d68eb8","resolution":{"observed_at":"2026-08-09T05:28:53.255005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-09T05:28:51.788616Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.788616Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:ab0ce9b1bd6f1112994a5674b943ad976285564b55499621e9bb211273d6b81b","observation_id":"42c48d34-487b-4c4c-a673-849b591f0d9d","resolution":{"observed_at":"2026-08-09T05:28:51.788616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.235005Z","title":"and Kolter, J","venue":null,"work_id":"f088114f-1162-4f86-ae47-4d2eb14fbc6d","year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.793071Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:1fc74da46917e0b9230fcd7188eccfbd4f32b3d75b2263c69142821a09763f05","observation_id":"58695419-ce1f-4005-9824-f486b8936afa","resolution":{"observed_at":"2026-08-09T05:28:53.239723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.218716Z","title":"Deepnet: Scaling transformers to 1,000 layers","venue":null,"work_id":"044489c3-d8c7-48f8-bf02-f2b0d4a2da1a","year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.797195Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:5bb9c1cf3d492fcd514bfe3307e2ff44ae8f89eb59ea9a26af1e761d410dc16f","observation_id":"4569c100-5d1e-4abf-bf1c-3329d336f44d","resolution":{"observed_at":"2026-08-09T05:28:53.224112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14160","last_updated":"2023-12-19T15:13:52Z","snapshot_observed_at":"2026-08-04T17:03:48.643939Z","submitted_at":"2023-05-23T15:26:20Z","title":"Label Words are Anchors: An Information Flow Perspective for Understanding In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14160","snapshot_observed_at":"2026-08-09T05:28:51.801401Z","title":"Label words are anchors: An information flow perspective for understanding in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.801401Z"},"links":{"cited_paper":"/paper/2305.14160","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:a88bc661ac6251d6a69f18d6c8aeb4cf3251b303675588689367dfe3e922a455","observation_id":"bd5896f8-8a41-4384-8067-67e48f6e9198","resolution":{"observed_at":"2026-08-09T05:28:51.801401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20763","last_updated":"2024-10-31T11:28:58Z","snapshot_observed_at":"2026-07-06T18:23:15.098065Z","submitted_at":"2024-05-31T12:32:34Z","title":"Improving Generalization and Convergence by Enhancing Implicit Regularization","version":4},"cited_work":{"arxiv_id":"2405.20763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.20763","snapshot_observed_at":"2026-08-09T05:28:52.586483Z","title":"Improving Generalization and Convergence by Enhancing Implicit Regularization","venue":"cs.LG","work_id":"921cf79f-c5ea-4c6a-aacf-3047fb558a2e","year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.806335Z"},"links":{"cited_paper":"/paper/2405.20763","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:8e73092c32f77574c0fdcf601709add05644efdedb2b2453d48b2b46519b6cce","observation_id":"be13f3e7-9ac0-4b58-9233-54524425ebdd","resolution":{"observed_at":"2026-08-09T05:28:52.592722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00522","last_updated":"2024-10-30T08:47:36Z","snapshot_observed_at":"2026-08-07T03:55:49.472520Z","submitted_at":"2024-02-01T11:43:13Z","title":"Understanding the Expressive Power and Mechanisms of Transformer for Sequence Modeling","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00522","snapshot_observed_at":"2026-08-09T05:28:51.810922Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.810922Z"},"links":{"cited_paper":"/paper/2402.00522","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:241f497a5c8f33f76d2044db7b371899ffd0eaf2c3041c62679b7d3b23677b23","observation_id":"ed352f33-948f-4aad-a02e-453e9df0eec5","resolution":{"observed_at":"2026-08-09T05:28:51.810922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15302","last_updated":"2025-09-09T02:51:58Z","snapshot_observed_at":"2026-07-06T18:19:08.871953Z","submitted_at":"2024-05-24T07:41:26Z","title":"Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15302","snapshot_observed_at":"2026-08-09T05:28:51.815997Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.815997Z"},"links":{"cited_paper":"/paper/2405.15302","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:a0af858ed20f7b0152842c188bec8bfd2e54c1ebddce4a289827974a7f8e283b","observation_id":"39617b73-84ee-4467-93fb-da96bb31208f","resolution":{"observed_at":"2026-08-09T05:28:51.815997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.170886Z","title":"H., Hashimoto, T., Vinyals, O., Liang, P., Dean, J., and Fedus, W","venue":null,"work_id":"0c57b9e5-6f76-422b-80ef-212f4526a624","year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.820681Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:99e42ae3b61b879294724800f6aa004ec060e967082b5887378b7f4b995b0edd","observation_id":"cd478da5-6f8d-4d05-b085-6e5dad8133da","resolution":{"observed_at":"2026-08-09T05:28:53.199486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-09T05:28:51.824742Z","title":"Chain of thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.824742Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:604602f7c52155733529b7c018a6b6fdee15024018984548e755e2194dd84138","observation_id":"b2f1df8b-9f3c-4c1d-b4b7-40cc19ef6a2f","resolution":{"observed_at":"2026-08-09T05:28:51.824742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07842","last_updated":"2019-06-18T23:21:56Z","snapshot_observed_at":"2026-08-07T23:54:50.772958Z","submitted_at":"2019-06-18T23:21:56Z","title":"Gradient Dynamics of Shallow Univariate ReLU Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07842","snapshot_observed_at":"2026-08-09T05:28:51.829313Z","title":"T., Panozzo, D., Zorin, D., and Bruna, J","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.829313Z"},"links":{"cited_paper":"/paper/1906.07842","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:52a01b8f5d2e455750941d08d57c1ab2394faf8c9f92adc00b3308c656b3ea2c","observation_id":"fb5e145f-64c4-4f27-bd06-d99b826300bc","resolution":{"observed_at":"2026-08-09T05:28:51.829313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09484","last_updated":"2026-04-12T13:30:14Z","snapshot_observed_at":"2026-07-06T21:08:33.353144Z","submitted_at":"2025-04-13T08:50:24Z","title":"An overview of condensation phenomenon in deep learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09484","snapshot_observed_at":"2026-08-09T05:28:51.834240Z","title":"J., Zhang, Y., and Zhou, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.834240Z"},"links":{"cited_paper":"/paper/2504.09484","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:1d14bce7b10f0c9c0696c60aaa786daa6a0ba50680173067b0470afcd0d13263","observation_id":"b8ea9d09-8e59-40d0-912b-10b067bfa388","resolution":{"observed_at":"2026-08-09T05:28:51.834240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17271","last_updated":"2023-05-28T03:37:47Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:05Z","title":"Do Vision-Language Pretrained Models Learn Composable Primitive Concepts?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17271","snapshot_observed_at":"2026-08-09T05:28:51.838929Z","title":"Do vision-language pretrained models learn composable primitive concepts? arXiv preprint arXiv:2203.17271, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.838929Z"},"links":{"cited_paper":"/paper/2203.17271","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:051ca9f1cd4237c4f64f5913b1afe7c7d4262c797fc6b1556fb95b53af60424d","observation_id":"54c580f6-6c77-4e44-9636-09a75b1d5d17","resolution":{"observed_at":"2026-08-09T05:28:51.838929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11365","last_updated":"2019-08-29T17:50:55Z","snapshot_observed_at":"2026-08-08T10:42:09.209323Z","submitted_at":"2019-08-29T17:50:55Z","title":"Improving Deep Transformer with Depth-Scaled Initialization and Merged Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11365","snapshot_observed_at":"2026-08-09T05:28:51.843650Z","title":"Improving deep transformer with depth-scaled initialization and merged attention","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.843650Z"},"links":{"cited_paper":"/paper/1908.11365","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:c035360c02efe23e8db17adde26f7af4dfc05847c5ec1b9f491e0eaa51a1e2c2","observation_id":"172990d3-9470-4d19-b1b3-d190604287c2","resolution":{"observed_at":"2026-08-09T05:28:51.843650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-09T05:28:51.848843Z","title":"Understanding deep learning requires rethinking generalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.848843Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:b2e7582a787f1628f6da5c4ff540e94d989a8fca1152f84c3bb9fb5858e7c38e","observation_id":"fe9d802e-28cb-41b2-a937-ba971030ca36","resolution":{"observed_at":"2026-08-09T05:28:51.848843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07777","last_updated":"2020-06-01T09:54:18Z","snapshot_observed_at":"2026-07-06T07:54:02.817335Z","submitted_at":"2019-05-19T17:11:42Z","title":"A type of generalization error induced by initialization in deep neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07777","snapshot_observed_at":"2026-08-09T05:28:51.853798Z","title":"J., Luo, T., and Ma, Z","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.853798Z"},"links":{"cited_paper":"/paper/1905.07777","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:bb9432677189b9ea16d0ec1df20a02d76e449d9436d54346f4363337e4177666","observation_id":"38bcef4a-6788-4061-a647-f77c37aae9d4","resolution":{"observed_at":"2026-08-09T05:28:51.853798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11623","last_updated":"2022-11-21T16:27:25Z","snapshot_observed_at":"2026-08-10T04:11:15.655028Z","submitted_at":"2022-11-21T16:27:25Z","title":"Linear Stability Hypothesis and Rank Stratification for Nonlinear Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11623","snapshot_observed_at":"2026-08-09T05:28:51.858900Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.858900Z"},"links":{"cited_paper":"/paper/2211.11623","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:5ec2039a3f2f9b556f59dc93f8d10e88efe4cc780a7245dc134136ff84ef6cf9","observation_id":"add21f00-2939-48fa-90f9-e7ad69b09681","resolution":{"observed_at":"2026-08-09T05:28:51.858900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12133","last_updated":"2024-10-05T05:40:02Z","snapshot_observed_at":"2026-08-07T23:54:18.992816Z","submitted_at":"2023-05-20T07:57:15Z","title":"Loss Spike in Training Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12133","snapshot_observed_at":"2026-08-09T05:28:51.863442Z","title":"and Xu, Z.-Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.863442Z"},"links":{"cited_paper":"/paper/2305.12133","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:8206666dc131d68e85e54a5586f272220836430ffbca6c1779155d0a962a52e3","observation_id":"f822a794-272e-45e8-9b20-e0794a811df3","resolution":{"observed_at":"2026-08-09T05:28:51.863442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:53.103715Z","title":"and Xu, Z.-Q","venue":null,"work_id":"1b5db8b9-522f-49ae-a600-fc00d997154e","year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:51.928943Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:fc818dcb1d6307fc4cc41309cfdc34ea7dd3e13fe720436098f0bcc4e79682ce","observation_id":"1c412bb4-6094-4512-b027-703e74fbdc37","resolution":{"observed_at":"2026-08-09T05:28:53.141956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15850","last_updated":"2023-05-25T08:42:25Z","snapshot_observed_at":"2026-08-10T04:00:57.539379Z","submitted_at":"2023-05-25T08:42:25Z","title":"Stochastic Modified Equations and Dynamics of Dropout Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15850","snapshot_observed_at":"2026-08-09T05:28:52.046608Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.046608Z"},"links":{"cited_paper":"/paper/2305.15850","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:c29e72515947ed7d542282182cc0e45ad33dbfcaf888a78b0f6f138f1bbc57d4","observation_id":"a52381c9-da47-499e-8db9-e5007416eeac","resolution":{"observed_at":"2026-08-09T05:28:52.046608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:52.989784Z","title":null,"venue":null,"work_id":"54b9a215-2501-4526-b606-e25e575b4008","year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.153482Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:46a219ba8fde406d29aa5ec9754b3e1c8ec061a1f8a958fb1456d27a77825617","observation_id":"ec5d6f10-a553-4fa8-b59c-f0dcbcacc58d","resolution":{"observed_at":"2026-08-09T05:28:53.029678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08309","last_updated":"2024-01-16T12:10:49Z","snapshot_observed_at":"2026-08-10T07:07:03.830031Z","submitted_at":"2024-01-16T12:10:49Z","title":"Anchor function: a type of benchmark functions for studying language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08309","snapshot_observed_at":"2026-08-09T05:28:52.234294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.234294Z"},"links":{"cited_paper":"/paper/2401.08309","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:4cd69e2ab3c3e65f6340c61f0bdd695c9a0007c9a4ed4b86b7c965f5a1198a2d","observation_id":"ef590fc0-5244-4723-aa78-0af3468e01e1","resolution":{"observed_at":"2026-08-09T05:28:52.234294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08537","last_updated":"2025-01-15T02:54:52Z","snapshot_observed_at":"2026-08-07T23:54:16.915647Z","submitted_at":"2025-01-15T02:54:52Z","title":"Complexity Control Facilitates Reasoning-Based Compositional Generalization in Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08537","snapshot_observed_at":"2026-08-09T05:28:52.265267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.265267Z"},"links":{"cited_paper":"/paper/2501.08537","citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:796ce3148bb174c31eb5c466766043f3dec4b688e3fa92706e813c183b83da84","observation_id":"f2c555c6-f9b4-4532-8140-f292ba9d8258","resolution":{"observed_at":"2026-08-09T05:28:52.265267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:52.909064Z","title":null,"venue":null,"work_id":"8b6748f0-5b0a-42d2-83e0-c5f7c3c4eefe","year":2022},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.270541Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:303eabb7f99ac3883a1fe6a845d008a7bfe1f34b8c2aabb63f7320220e0e3a72","observation_id":"d9937e27-fdfb-49b8-bc92-a1b7cf3b48f5","resolution":{"observed_at":"2026-08-09T05:28:52.931262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:52.892575Z","title":"R., and Goldstein, T","venue":null,"work_id":"0ebe2d63-c508-43fb-abe3-7b6231258e13","year":2021},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.275817Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:518ad239afa84ce395c245dd512aa2129d1d20841d3f5fda89b6a862de5f65bf","observation_id":"0c30e867-4b53-4098-b86a-c8789600bfe7","resolution":{"observed_at":"2026-08-09T05:28:52.897390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:28:52.279862Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T05:28:52.279862Z"},"links":{"citing_paper":"/paper/2502.04375"},"observation_digest":"sha256:0e472444c0327bdb36377c6120bd395482879258dcded06957e1d1c3351fc3ef","observation_id":"2bf11d20-18e9-4d4b-9d59-2321367ceb6a","resolution":{"observed_at":"2026-08-09T05:28:52.279862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04375","last_updated":"2025-05-21T09:17:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T05:46:11.244583Z","submitted_at":"2025-02-05T15:23:26Z","title":"An Analysis for Reasoning Bias of Language Models with Small Initialization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2502.04375."}