{"as_of":"2026-08-18T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f3a0c52a6cc52958965274eedf87bfd6f307b3a7ead2dc608e31838a7dec4e1","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:16:39.037683Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13425/citation-record","integrity":"/paper/2607.13425/integrity","json":"/paper/2607.13425/citation-record.json","paper":"/paper/2607.13425"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.806129Z","title":"16 Published as a conference paper at COLM 2026 Figure A.3: Effect of manually changing the β for only L15H14 and L15H3 of Llama-3.2-1B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.806129Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:714bdd92d4927c4596e17927c35138e93170a9c001437b3d23ec71ba266e3ef3","observation_id":"aa6c1979-5964-4c16-b2c6-06e468c203a7","resolution":{"observed_at":"2026-08-02T05:16:38.806129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:33.459231Z","title":"Saes are good for steering–if you select the right features.arXiv preprint arXiv:2505.20063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.459231Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:c5790a3e051d611616197be6fb5f1f8e80b4c9f1c85d1595a70fdc1c057554dc","observation_id":"1e602ddc-cf30-48ad-8398-294931698b7a","resolution":{"observed_at":"2026-08-02T05:16:33.459231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.037683Z","title":"Benign Toxigen asians are trying to take over the world with their karate skills Toxic Table A.2: Data examples","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.037683Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:d1c1f3544562e1d4c8a374f3629e7998bd99af9f8a991d1aad56db6b982d3231","observation_id":"10242a19-6248-4b67-92e0-1a0090a083c3","resolution":{"observed_at":"2026-08-02T05:16:39.037683Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06105","last_updated":"2025-06-09T14:19:59Z","snapshot_observed_at":"2026-08-12T19:22:14.414860Z","submitted_at":"2025-06-06T14:11:27Z","title":"Text-to-LoRA: Instant Transformer Adaption","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06105","snapshot_observed_at":"2026-08-02T05:16:33.950753Z","title":"Text-to-lora: Instant transformer adaption.arXiv preprint arXiv:2506.06105,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.950753Z"},"links":{"cited_paper":"/paper/2506.06105","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:f28f9349495e2a63607c5218d77f19ee15a3ae870e1cb591ca5e5706b0831242","observation_id":"866674f5-5551-4546-8bd2-b1b275555fc4","resolution":{"observed_at":"2026-08-02T05:16:33.950753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.117270Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta- optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.117270Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:ec127270b5a8c0e0b5391451995b675aa209e4043a38c9e06f28fd40a6d25157","observation_id":"c6174560-2a13-4d04-b2f3-d8203ab9de85","resolution":{"observed_at":"2026-08-02T05:16:34.117270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11338","last_updated":"2024-04-17T12:58:51Z","snapshot_observed_at":"2026-08-18T12:49:10.901872Z","submitted_at":"2024-04-17T12:58:51Z","title":"LLMs for Cyber Security: New Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11338","snapshot_observed_at":"2026-08-02T05:16:34.184746Z","title":"Llms for cyber security: New opportunities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.184746Z"},"links":{"cited_paper":"/paper/2404.11338","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:1660e3624a10fa85acf072a07385ca5ca895ca1e985f78254703357acaae9c9b","observation_id":"eb689561-baf6-4e49-85be-9a7d08af0319","resolution":{"observed_at":"2026-08-02T05:16:34.184746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T05:16:34.344751Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.344751Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:b7e016b737f98517ce9f4d1d2fea9c5a58f39e9f85d50a6fc66ed9606acc6411","observation_id":"c18c3230-eaeb-4649-8f06-fd766d9a1062","resolution":{"observed_at":"2026-08-02T05:16:34.344751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.407222Z","title":"A mathematical framework for transformer circuits.T ransformer Circuits Thread, 1,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.407222Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:13daf7708c584ba1b03025175cc77bce4e3c081d6a06b476f77b789d8038e1eb","observation_id":"a00115bf-1fd1-4002-b43c-bda853ac0ebe","resolution":{"observed_at":"2026-08-02T05:16:34.407222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-02T05:16:34.679219Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.679219Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:2d2a31e74270a31518771637e2b227e5addf553a2965660baa7f99aa814ad58e","observation_id":"349370b8-957c-4d00-b179-ba2a8a153be1","resolution":{"observed_at":"2026-08-02T05:16:34.679219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13009","last_updated":"2024-11-21T16:49:51Z","snapshot_observed_at":"2026-08-18T05:16:39.450049Z","submitted_at":"2024-11-20T03:17:51Z","title":"LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13009","snapshot_observed_at":"2026-08-02T05:16:34.803313Z","title":"Llmsteer: Improving long-context llm inference by steering attention on reused contexts.arXiv preprint arXiv:2411.13009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.803313Z"},"links":{"cited_paper":"/paper/2411.13009","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:de77fc95ff73a902c5293c38bbb43a25a7086ae4acf1846b913804da7912b62d","observation_id":"b9fb7039-8686-44f8-831d-577509f9a2dd","resolution":{"observed_at":"2026-08-02T05:16:34.803313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.869025Z","title":"Instruction following by boosting attention of large language models.arXiv preprint arXiv:2506.13734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.869025Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:025efc110b89cce5df02a2051ce494c530003725f1b7085bd4520b6c67d6e53c","observation_id":"fb912a9a-f0d3-4b97-a558-af7e81ab5746","resolution":{"observed_at":"2026-08-02T05:16:34.869025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-02T05:16:35.003700Z","title":"Parameter-efficient fine-tuning for large models: A comprehensive survey.arXiv preprint arXiv:2403.14608,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.003700Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:f6271b55c6d962177675a07888681643afd47d390dca657266b02e91c3b3c7f5","observation_id":"eba31d0b-e8a3-4f5f-a392-7b5974071790","resolution":{"observed_at":"2026-08-02T05:16:35.003700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.162603Z","title":"Thomas Hartvigsen, Saadia Gabriel, Hamid Palangi, Maarten Sap, Dipankar Ray, and Ece Kamar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.162603Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:40a0482c9780cdead776a0612b91bebf9287c4c26394fb9d9e988755c4744dce","observation_id":"ff61597d-757b-4497-8abb-527e60254917","resolution":{"observed_at":"2026-08-02T05:16:35.162603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12354","last_updated":"2024-07-04T18:33:00Z","snapshot_observed_at":"2026-08-16T14:17:14.074196Z","submitted_at":"2024-02-19T18:33:49Z","title":"LoRA+: Efficient Low Rank Adaptation of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12354","snapshot_observed_at":"2026-08-02T05:16:35.236489Z","title":"Lora+: Efficient low rank adaptation of large models.arXiv preprint arXiv:2402.12354,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.236489Z"},"links":{"cited_paper":"/paper/2402.12354","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:d9766d05415a2537cb7b50618e65ff989034ea28c05e0cccda7bd2396d46fbf9","observation_id":"b77cb31c-c8b4-4b19-ac74-601b16986bcd","resolution":{"observed_at":"2026-08-02T05:16:35.236489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20629","last_updated":"2025-06-25T17:25:02Z","snapshot_observed_at":"2026-08-17T15:08:28.482973Z","submitted_at":"2025-06-25T17:25:02Z","title":"PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20629","snapshot_observed_at":"2026-08-02T05:16:35.355130Z","title":"Plop: Precise lora placement for efficient finetuning of large models.arXiv preprint arXiv:2506.20629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.355130Z"},"links":{"cited_paper":"/paper/2506.20629","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:ba6bcd230e85722c7e299044b59c3b03f568f9e5ebaf05c6691afbfd2c502300","observation_id":"b39c9925-8b32-4b65-8f19-cfb6d7b58af3","resolution":{"observed_at":"2026-08-02T05:16:35.355130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-02T05:16:35.477811Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations.arXiv preprint arXiv:2312.06674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.477811Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:b26ada7954aca20e99ec730b5514a9d2129c7182ac321735e4761b00b186497a","observation_id":"d6c2cda4-7d5f-43f0-88bb-1d5c1273bd0d","resolution":{"observed_at":"2026-08-02T05:16:35.477811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.598559Z","title":"Interpretable language modeling via induction-head ngram models.arXiv preprint arXiv:2411.00066,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.598559Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:a3fea6e030bbd17397809ec8c0f1f7a62fadef03ba6500fcfb919ee30d3eb83e","observation_id":"d94a758d-88cc-494e-a51b-b7d8c1345ab7","resolution":{"observed_at":"2026-08-02T05:16:35.598559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02329","last_updated":"2022-10-10T15:25:40Z","snapshot_observed_at":"2026-08-16T17:09:06.658141Z","submitted_at":"2022-04-05T16:33:44Z","title":"Can language models learn from explanations in context?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02329","snapshot_observed_at":"2026-08-02T05:16:35.721598Z","title":"Can language models learn from explanations in context?arXiv preprint arXiv:2204.02329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.721598Z"},"links":{"cited_paper":"/paper/2204.02329","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:5cbf97234dea7af84e534f9d66ebe868172e086e91f2d6055c08bb91edd52641","observation_id":"df06a5ab-28c0-4566-8523-0ea5e9c18f26","resolution":{"observed_at":"2026-08-02T05:16:35.721598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-02T05:16:35.845222Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.845222Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:666c6905581aefc61d36861064035fff086df65fa9cd8738819291bf8f506804","observation_id":"c53170b5-cf69-4806-926d-be528e39b366","resolution":{"observed_at":"2026-08-02T05:16:35.845222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.968374Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning.Advances in Neural Information Processing Systems, 35:1950–1965,","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.968374Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:dc7d6ffeaf7ec989e790e15615117803acb8640fd6afe73c84e0301b6b5a2410","observation_id":"6f7758fc-15a1-47ba-b6b0-bd0b59475268","resolution":{"observed_at":"2026-08-02T05:16:35.968374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-18T04:49:12.041312Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-02T05:16:36.094425Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.094425Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:db4e9eb20a0003a17b6b1c53fbc3276a7e783a34b3d8b467d53f765572df5df8","observation_id":"5b3c18af-c98d-4cee-b9db-e189de7098a7","resolution":{"observed_at":"2026-08-02T05:16:36.094425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.214940Z","title":"Cutting down on prompts and parameters: Simple few-shot learning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.214940Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:ac80261935b272f86ab8347f3c21393461ede638735f0f5211efd97bd20ef0a3","observation_id":"ae160b8c-270d-45f4-9138-c44f412dd394","resolution":{"observed_at":"2026-08-02T05:16:36.214940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.396360Z","title":"Rethinking the role of demonstrations: What makes in-context learning work? InProceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.396360Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:ecd4cb3fee3d3ff5ee72ac6273a8c204b93f2e26f6e507dbe58a9650e98dc5c6","observation_id":"043a2276-47a7-4c3e-9cad-a2a2f18f65b4","resolution":{"observed_at":"2026-08-02T05:16:36.396360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14034","last_updated":"2023-10-21T15:18:22Z","snapshot_observed_at":"2026-08-16T14:50:09.401903Z","submitted_at":"2023-10-21T15:18:22Z","title":"Tree Prompting: Efficient Task Adaptation without Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14034","snapshot_observed_at":"2026-08-02T05:16:36.544435Z","title":"Tree prompting: efficient task adaptation without fine-tuning.arXiv preprint arXiv:2310.14034,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.544435Z"},"links":{"cited_paper":"/paper/2310.14034","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:6b3b7eb45212d30f036dc71209c06656c4450f08b02a14f8ccf5150c07cf33ff","observation_id":"3fb4b496-45f2-4177-844e-f3142d249ff7","resolution":{"observed_at":"2026-08-02T05:16:36.544435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06855","last_updated":"2024-05-10T23:48:37Z","snapshot_observed_at":"2026-08-16T13:53:36.627299Z","submitted_at":"2024-05-10T23:48:37Z","title":"Linear Explanations for Individual Neurons","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06855","snapshot_observed_at":"2026-08-02T05:16:36.686388Z","title":"Linear explanations for individual neurons.arXiv preprint arXiv:2405.06855,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.686388Z"},"links":{"cited_paper":"/paper/2405.06855","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:0da2ffcb69499fa508dfffd6dc54a0c85db39eda663e4690456480ae187b7b05","observation_id":"69c6fe16-0268-4eb2-9398-2d6f16c0b0db","resolution":{"observed_at":"2026-08-02T05:16:36.686388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-15T09:43:59.961298Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-02T05:16:36.791417Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.791417Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:3c453a1f1ca40ee2554b1b3d94b998aa248c5546d43088ce63cd9d27103d7061","observation_id":"c03c640d-c251-4582-b022-0a6566db27ea","resolution":{"observed_at":"2026-08-02T05:16:36.791417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11157","last_updated":"2024-05-18T03:02:23Z","snapshot_observed_at":"2026-08-17T02:05:09.874645Z","submitted_at":"2024-05-18T03:02:23Z","title":"Towards Modular LLMs by Building and Reusing a Library of LoRAs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11157","snapshot_observed_at":"2026-08-02T05:16:36.867664Z","title":"Towards modular llms by building and reusing a library of loras.arXiv preprint arXiv:2405.11157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.867664Z"},"links":{"cited_paper":"/paper/2405.11157","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:6ae14c9838db4ab00b3d917d8dc596b23198bf87d4eab55032ede8fedde52cc5","observation_id":"eba88f4f-c4ec-4189-9331-6250b8d9c8e6","resolution":{"observed_at":"2026-08-02T05:16:36.867664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05970","last_updated":"2023-04-12T16:47:15Z","snapshot_observed_at":"2026-08-17T13:11:01.917900Z","submitted_at":"2023-04-12T16:47:15Z","title":"Boosted Prompt Ensembles for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05970","snapshot_observed_at":"2026-08-02T05:16:36.968561Z","title":"Boosted prompt ensembles for large language models.arXiv preprint arXiv:2304.05970,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.968561Z"},"links":{"cited_paper":"/paper/2304.05970","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:beaec91e1bbb3f66d5e6f01453f6cafe0677b18ca2e29fb80f028a1ffdacbe22","observation_id":"a5189fa9-de82-426c-b5a5-1f981d3d423f","resolution":{"observed_at":"2026-08-02T05:16:36.968561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.074184Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.074184Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:405b9aa84055ea2bf523d87522c49e7561fb3f9c1a9e216404bf114cac464b50","observation_id":"635a2f3b-32f5-415d-baea-924df0a9461e","resolution":{"observed_at":"2026-08-02T05:16:37.074184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.181842Z","title":"Carer: Contextualized affect representations for emotion recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.181842Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:dbc7595c5f694f535ec4c15a3c4707a7ba3b6681ab4a60ea2f980651274160ac","observation_id":"76fddd72-5c2a-42f0-9d4b-e0a2493f8e19","resolution":{"observed_at":"2026-08-02T05:16:37.181842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15542","last_updated":"2023-07-11T17:57:06Z","snapshot_observed_at":"2026-08-17T08:31:24.897714Z","submitted_at":"2023-05-24T20:03:04Z","title":"TOAST: Transfer Learning via Attention Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15542","snapshot_observed_at":"2026-08-02T05:16:37.282553Z","title":"Toast: Transfer learning via attention steering.arXiv preprint arXiv:2305.15542,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.282553Z"},"links":{"cited_paper":"/paper/2305.15542","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:0e528d80c3b65cfc33fa3036f485411946d2cc3761aebe2d827df8c4606c7ec7","observation_id":"d20c03ec-4149-44ac-a3cd-8ed18a693e52","resolution":{"observed_at":"2026-08-02T05:16:37.282553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-16T19:09:26.533311Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-08-02T05:16:37.430466Z","title":"Au- toprompt: Eliciting knowledge from language models with automatically generated prompts.arXiv preprint arXiv:2010.15980,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.430466Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:8af9f6db385772a18d774e82f9d39e2b376186ef081c6a84908bee7ca3d311c8","observation_id":"a363a49a-871c-4b1c-a5bf-4cfbbb3b98b8","resolution":{"observed_at":"2026-08-02T05:16:37.430466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09863","last_updated":"2023-11-15T17:19:10Z","snapshot_observed_at":"2026-08-16T16:10:05.266696Z","submitted_at":"2023-05-17T00:29:18Z","title":"Explaining black box text modules in natural language with language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09863","snapshot_observed_at":"2026-08-02T05:16:37.578983Z","title":"Explaining black box text modules in natural language with language models.arXiv preprint arXiv:2305.09863, 2023a","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.578983Z"},"links":{"cited_paper":"/paper/2305.09863","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:bf1026e1dd267d1708d80c1b1d0c08603bcf4df0889931c85a5dc2b11b8742da","observation_id":"427990ea-8762-4e74-9408-c3a1b7763847","resolution":{"observed_at":"2026-08-02T05:16:37.578983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.734929Z","title":"Multiguard: An efficient approach for ai safety moderation across languages and modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.734929Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:8999f45c57e59fd009488ea83d3e0943b6f13eee84774e616bcb58c7afbb5403","observation_id":"ea0f4dda-7a85-4a24-94d2-d31e0e8419f3","resolution":{"observed_at":"2026-08-02T05:16:37.734929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19878","last_updated":"2025-04-24T07:20:31Z","snapshot_observed_at":"2026-08-16T13:06:16.410317Z","submitted_at":"2024-10-24T13:58:59Z","title":"Parameter-Efficient Fine-Tuning in Large Models: A Survey of Methodologies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19878","snapshot_observed_at":"2026-08-02T05:16:37.830928Z","title":"Parameter-efficient fine-tuning in large models: A survey of methodologies.arXiv preprint arXiv:2410.19878,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.830928Z"},"links":{"cited_paper":"/paper/2410.19878","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:1e1e6199cb294bde8585d0791b9d2adeb45349fde844ed08652830cb875bbe5e","observation_id":"606f1a5f-4352-4304-828e-39508d45c43a","resolution":{"observed_at":"2026-08-02T05:16:37.830928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.924291Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.924291Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:899d41f124e87d677b6cb54c292ff93059de126b8514f55797711846af66fe42","observation_id":"ce808fa4-cae6-447d-9609-f7a29ef9911b","resolution":{"observed_at":"2026-08-02T05:16:37.924291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-08-18T13:27:58.239266Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-08-02T05:16:38.005390Z","title":"Larger language models do in-context learning differently.arXiv preprint arXiv:2303.03846,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.005390Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:c70add20f871bc489b75fc1cea8f0190dbe23e0f703b4b6641f2e339e0aca002","observation_id":"e28cdf2d-ce2c-4581-9cb4-0770747ede57","resolution":{"observed_at":"2026-08-02T05:16:38.005390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.206218Z","title":"14 Published as a conference paper at COLM 2026 An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.206218Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:df20cfe230f004066d7a725d28485305b6abddb2a7b7659edfbfa9c30a14e7de","observation_id":"84f9742c-ab48-4bcd-87c2-9845b0f5eaea","resolution":{"observed_at":"2026-08-02T05:16:38.206218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-02T05:16:38.264743Z","title":"Jailbreak attacks and defenses against large language models: A survey.arXiv preprint arXiv:2407.04295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.264743Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:368d9924b1e0d39c2c2c090a95cd090dde6b4ca96766fb192870572cbafbb54b","observation_id":"bd19f5ff-9938-457c-b299-df83429a8cf1","resolution":{"observed_at":"2026-08-02T05:16:38.264743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-08-12T23:46:47.414754Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-02T05:16:38.354412Z","title":"Parameter- efficient fine-tuning for foundation models, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.354412Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:064de1b449a13937b139ed577928feaeab8409948575b14a7c5be77040d4a86b","observation_id":"32b40834-0437-4e2c-bde4-38900fee5ac9","resolution":{"observed_at":"2026-08-02T05:16:38.354412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-08-17T11:53:58.758448Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-08-02T05:16:38.528279Z","title":"Large language models are human-level prompt engineers.arXiv preprint arXiv:2211.01910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.528279Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:c5192f51d88a7417351f7de7872dd1b9e08286aad2af831662791dc36d70ffba","observation_id":"9d3045a8-7dc9-4b2d-b47e-a9a7dd16eede","resolution":{"observed_at":"2026-08-02T05:16:38.528279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.641666Z","title":"Vector-icl: In-context learning with continuous vector representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.641666Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:ddba5b1b4c31520b6ae1425f74ec87ad25cef287da0cc5ff4389dff33443d852","observation_id":"a16a8fb4-4a03-4bcc-97a6-9acf0cf73380","resolution":{"observed_at":"2026-08-02T05:16:38.641666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.720077Z","title":"We can see it only pays attention to thePhishingtokens regardless of current input’s label","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.720077Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:d7ffcd34a8ba808be797c70bd6d160ba8fe8d25e27d665daccdfc23b20a4f1c6","observation_id":"680b9f80-bd15-4d6c-9d2f-e04a7275b009","resolution":{"observed_at":"2026-08-02T05:16:38.720077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.875579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.875579Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:4ab026468f890866473313a33e7823517ce9d14462b39ee83981e84b5a57c0f1","observation_id":"1094f8b0-f6fb-43fb-b18a-fd4c8a63d273","resolution":{"observed_at":"2026-08-02T05:16:38.875579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.976574Z","title":"Reuters - Short-sellers, Wall Street’s dwindling band of ultra-cynics, are seeing green again","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.976574Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:48e533b3cd31c205bbde158b584d723e087b12a0c7fe8cac21a1ad35553612bb","observation_id":"e85dcfb0-9cf5-4286-a18a-e9dd7a5148c8","resolution":{"observed_at":"2026-08-02T05:16:38.976574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.677814Z","title":"In-context algebra.arXiv preprint arXiv:2512.16902,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.677814Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:7d18d8d1438ba4b4094b7ddb8b83ceba698e050f340123976aec811d55453c40","observation_id":"68356312-b044-489a-bd16-7ec81e8e10e6","resolution":{"observed_at":"2026-08-02T05:16:37.677814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09819","last_updated":"2025-03-12T20:34:14Z","snapshot_observed_at":"2026-08-16T12:50:35.667823Z","submitted_at":"2025-03-12T20:34:14Z","title":"Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09819","snapshot_observed_at":"2026-08-02T05:16:38.472499Z","title":"Attention reveals more than tokens: Training-free long-context reasoning with attention-guided retrieval.arXiv preprint arXiv:2503.09819, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.472499Z"},"links":{"cited_paper":"/paper/2503.09819","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:5f36ca411e6f81ab970e6698abb85f394d6bf5d0a24aa9007de98414b47440b8","observation_id":"901248f3-f454-4ada-9782-458522a72c34","resolution":{"observed_at":"2026-08-02T05:16:38.472499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-16T15:17:57.789299Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-02T05:16:36.311036Z","title":"One step of gradient descent is provably the optimal in-context learner with one layer of linear self-attention.arXiv preprint arXiv:2307.03576,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.311036Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:79e23b551e25e1bb5f6844c0dee7fc90f865ec5fc8131be99c5c720ddc0c10c9","observation_id":"eabade07-68a9-46a9-baf1-a4117c9a85f4","resolution":{"observed_at":"2026-08-02T05:16:36.311036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-02T05:16:33.834746Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.834746Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:6d80bdc5a6f0bbd8ef41739c91f13ef4fd74dffc10d96c97c35547ca56582aaf","observation_id":"57e5a1e5-e8bb-437e-9e79-25a1da05a53e","resolution":{"observed_at":"2026-08-02T05:16:33.834746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09072","last_updated":"2026-01-14T02:04:34Z","snapshot_observed_at":"2026-08-18T07:05:43.115852Z","submitted_at":"2026-01-14T02:04:34Z","title":"Human-AI Co-design for Clinical Prediction Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.09072","snapshot_observed_at":"2026-08-02T05:16:34.504748Z","title":"Human-ai co-design for clinical prediction models.arXiv preprint arXiv:2601.09072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.504748Z"},"links":{"cited_paper":"/paper/2601.09072","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:3e92e3335756a5a9788f7bb2f23561b43f2177abf518d890a8c1b94cb67f1142","observation_id":"be28649a-bf12-4ed5-9070-c6665c5ec4b6","resolution":{"observed_at":"2026-08-02T05:16:34.504748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12973","last_updated":"2024-01-30T18:59:34Z","snapshot_observed_at":"2026-08-17T03:02:51.938247Z","submitted_at":"2024-01-23T18:59:21Z","title":"In-Context Language Learning: Architectures and Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12973","snapshot_observed_at":"2026-08-02T05:16:33.278944Z","title":"In-context language learning: Architectures and algorithms.arXiv preprint arXiv:2401.12973,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.278944Z"},"links":{"cited_paper":"/paper/2401.12973","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:10f3d36a6acd60d113f06fc9352f4caf5fe55408ec29966e8aa62b9608630805","observation_id":"6b7039ce-688f-4801-8c97-a49ecdef920e","resolution":{"observed_at":"2026-08-02T05:16:33.278944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:33.714035Z","title":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.714035Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:127b6c4ddb32ee5a2474572c69ac3a53ffe0771d20ced291e1fa92b659996eb4","observation_id":"069b6e8c-506f-4f37-b11f-a78aafc38c33","resolution":{"observed_at":"2026-08-02T05:16:33.714035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-15T11:54:11.033052Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-02T05:16:33.152469Z","title":"What learning algorithm is in-context learning? investigations with linear models.arXiv preprint arXiv:2211.15661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.152469Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:2c549efe77cd716ef6d0fdb69b7fda2d06107b23448aeae2c173bf547e76dceb","observation_id":"e8304cc5-4aef-4aaf-b75e-7f5c424ed18b","resolution":{"observed_at":"2026-08-02T05:16:33.152469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03016","last_updated":"2023-10-04T17:57:33Z","snapshot_observed_at":"2026-08-16T14:55:02.136822Z","submitted_at":"2023-10-04T17:57:33Z","title":"Understanding In-Context Learning in Transformers and LLMs by Learning to Learn Discrete Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03016","snapshot_observed_at":"2026-08-02T05:16:33.654611Z","title":"Understanding in- context learning in transformers and llms by learning to learn discrete functions.arXiv preprint arXiv:2310.03016,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:33.654611Z"},"links":{"cited_paper":"/paper/2310.03016","citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:db9e910c23dad17b84c24624bfcf5d574ccc331c535602f13ce4ab62a397f5d1","observation_id":"58c6e0f5-d1d2-4e60-884e-85add4ceb89e","resolution":{"observed_at":"2026-08-02T05:16:33.654611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.559521Z","title":"Weight-sparse transformers have interpretable circuits.arXiv preprint arXiv:2511.13653,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.559521Z"},"links":{"citing_paper":"/paper/2607.13425"},"observation_digest":"sha256:7de8ddb97f9b0cc4bf43b0ec9ede69991b96fefcdd86118a521572e07535ee57","observation_id":"471c4af1-5c8e-4430-b843-6a34adf5f833","resolution":{"observed_at":"2026-08-02T05:16:34.559521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13425","last_updated":"2026-07-15T04:03:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T22:11:34.311205Z","submitted_at":"2026-07-15T04:03:24Z","title":"Data-Efficient Adaptation of LLMs via Attention Head Reweighting"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.13425."}