{"as_of":"2026-08-13T20:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ba4e6db51003431ae95877cbc138d98111ed133e58394843b18ec0f4fb09b61","coverage":[{"denominator":277,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:44:44.107619Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20917/citation-record","integrity":"/paper/2506.20917/integrity","json":"/paper/2506.20917/citation-record.json","paper":"/paper/2506.20917"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-12T23:40:54.718397Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T22:44:42.951443Z","title":"Nemotron-4 340b technical report.arXiv preprint arXiv:2406.11704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.951443Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9807632fc75be857522b8ce5ce4890465f58905d7b9ca59f3ac3db781809a3a0","observation_id":"4b73827d-5f4f-4f31-819b-a794dfb137a7","resolution":{"observed_at":"2026-08-06T22:44:42.951443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:42.966717Z","title":"Publicly available clinical BERT embeddings","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.966717Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5bae1657dfbfb0d180fbdfa1c479f976ff8dc664e8ab54d30a2e9d68648874e1","observation_id":"8d58da42-ab95-45b2-a929-d5c97fcc36c8","resolution":{"observed_at":"2026-08-06T22:44:42.966717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:42.977418Z","title":"Reid, Stephen Gould, and Anton van den Hengel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.977418Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c82232402f6bf408ec0e50ed146c46f5a6f19ecb984b3f5fc550ab3a57735f9f","observation_id":"d875b45e-72aa-4a79-97fe-5717c8862855","resolution":{"observed_at":"2026-08-06T22:44:42.977418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02983","last_updated":"2020-06-29T08:18:31Z","snapshot_observed_at":"2026-08-13T04:05:24.032414Z","submitted_at":"2019-08-08T09:17:54Z","title":"Pseudo-Labeling and Confirmation Bias in Deep Semi-Supervised Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02983","snapshot_observed_at":"2026-08-06T22:44:43.098284Z","title":"Pseudo-labeling and confirmation bias in deep semi-supervised learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.098284Z"},"links":{"cited_paper":"/paper/1908.02983","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:162d5941b2176714960bb33c120f28c3e19e514b844d940747fa7f8867048efa","observation_id":"de2b65ba-e9fa-490f-b0aa-9524bb270450","resolution":{"observed_at":"2026-08-06T22:44:43.098284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.199897Z","title":"Tran, Dara Bahri, Jianmo Ni, Jai Prakash Gupta, Kai Hui, Sebastian Ruder, and Donald Metzler","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.199897Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f153717e09c3768ed1264f5f9a44fd9bcf5dc31941cde0b36457f53e535e65fb","observation_id":"13c2475a-6020-4db0-bf03-fbd2d68919fc","resolution":{"observed_at":"2026-08-06T22:44:43.199897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.209437Z","title":"A robust self-learning method for fully unsupervised cross-lingual mappings of word embeddings","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.209437Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:44b3a2d6a0695c05c6fdfc23b0f32fdfd24da42b49056ce29bcc4fdacd585cab","observation_id":"b706fb71-2eaa-44fe-b1ee-ab20c66b1dcf","resolution":{"observed_at":"2026-08-06T22:44:43.209437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.213678Z","title":"ATTEMPT: Parameter-efficient multi-task tuning via attentional mixtures of soft prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.213678Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8e9eb992284371384e0103cc9e7697dd92a36fa92e132b2184a863861b2a9438","observation_id":"7c41c763-bf8e-4833-8255-181336720d8c","resolution":{"observed_at":"2026-08-06T22:44:43.213678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T22:44:43.218178Z","title":"Program synthesis with large language models.ArXiv preprint, abs/2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.218178Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:6330be66147e68dd190a40620ee79e49c3960873aa009420542f89f9c6d445bf","observation_id":"cb805e14-e2aa-457e-93b7-6ac967060ede","resolution":{"observed_at":"2026-08-06T22:44:43.218178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.232106Z","title":"A general theoret- ical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.232106Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b9ca424f77ddfeff78fd58032035a9474084cb5eda5a22e08400b68ce4f3ce68","observation_id":"326ed919-0310-4d12-96cc-abb66d392730","resolution":{"observed_at":"2026-08-06T22:44:43.232106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:44:43.277409Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.277409Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bc75940b813db3826fd032e26dadc8c936c07f8b5a309f911f420cbc510b172f","observation_id":"c588d5d2-b57b-4974-9429-dfde47e4da1b","resolution":{"observed_at":"2026-08-06T22:44:43.277409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T22:44:43.346100Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.ArXiv preprint, abs/2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.346100Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7d5ce3d8ebbcf0caee7e97958dadcc9c3b68a82e75c02ab27aa1d277b8f9e9d6","observation_id":"73ab6ab2-a9fc-4a1f-9b19-3e278d9fb56f","resolution":{"observed_at":"2026-08-06T22:44:43.346100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.421930Z","title":"Brain power.Proceedings of the National Academy of Sciences, 118(32):e2107022118, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.421930Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:6cc23e4cd0f082604277c27f677fe8b1384d602a0b096469a8fdf14af013eed6","observation_id":"1d63966b-582c-458a-a353-c8ce30255fa7","resolution":{"observed_at":"2026-08-06T22:44:43.421930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.483528Z","title":"SciBERT: A pretrained language model for scientific text","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.483528Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f8ba06198cd46529ffbb4626b535175f782ef736688fb580bcc9b162a52954e9","observation_id":"c1dcd433-9c1f-4cc8-9b5a-81a82ff68d29","resolution":{"observed_at":"2026-08-06T22:44:43.483528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.535208Z","title":"BitFit: Sim- ple parameter-efficient fine-tuning for transformer-based masked language- models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.535208Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9aead8e2d8a2f23550f7a37741cef7fb4c19f16f26bb53542d3840c19ff614c1","observation_id":"45cd9730-f44b-49f8-b7a3-f76a57fa7777","resolution":{"observed_at":"2026-08-06T22:44:43.535208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.597280Z","title":"Bender, Timnit Gebru, Angelina McMillan-Major, and Shmargaret Shmitchell","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.597280Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f8126b19d22325837d6c2a3cd883eedaba5ec9f0f808b717dbad2843145cd0f6","observation_id":"f4135c37-405d-45af-8bad-6890dd4292b4","resolution":{"observed_at":"2026-08-06T22:44:43.597280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.732143Z","title":"Bender and Alexander Koller","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.732143Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:43a4d3e42a19214b28846d3ea6ee03b4338593f9a419536b472b29fee152c359","observation_id":"fe5548a5-b899-4d00-bc42-83efd4540425","resolution":{"observed_at":"2026-08-06T22:44:43.732143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.735683Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.735683Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9fb4ed1921be982749615d694f3a5f35c315d6a8c3d9499836ba14f88fa413f0","observation_id":"e892c41f-67e4-4c8e-b2f6-0e9409c15c00","resolution":{"observed_at":"2026-08-06T22:44:43.735683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.738874Z","title":"The fifth PASCAL recognizing textual entailment challenge","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.738874Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:686ef867d85d71b1a007acd7feea4924ed173e0c4ab3f69a9e3e27224d5eb1df","observation_id":"8ba42f1b-4a05-44d1-a5f5-188fe7c5356d","resolution":{"observed_at":"2026-08-06T22:44:43.738874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.742786Z","title":"Cubuk, Alex Kurakin, Kihyuk Sohn, Han Zhang, and Colin Raffel","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.742786Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5f12f4c0b72b1684a1b8ee4f83632caeb6f1d8bcf7991ce95f4a661cfd657cda","observation_id":"a0832af2-56e1-47af-8bba-2b9b04704280","resolution":{"observed_at":"2026-08-06T22:44:43.742786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.746891Z","title":"Goodfellow, Nicolas Papernot, Avital Oliver, and Colin Raffel","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.746891Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c416d0e1b1b755375722467de761c32d95de96fc15956b27fa6d7be62cbeb645","observation_id":"3c194945-8026-4ce1-ab53-234328ee7e19","resolution":{"observed_at":"2026-08-06T22:44:43.746891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.750663Z","title":"Adamatch: A unified approach to semi-supervised learning and domain adaptation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.750663Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e027aae325e78e97dabf1f2e1a6d09c743d7eb50363dd3fd9bd40a99e19fa7a8","observation_id":"49f58851-1f47-4f28-8cd0-f06bb0480165","resolution":{"observed_at":"2026-08-06T22:44:43.750663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.754753Z","title":"Shih, Yejin Choi, and Daniel Marcu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.754753Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1837f6c922b45789162b606ba0c8062011078a1af6d07239bfa321b39d7de154","observation_id":"647b04ba-67f9-4605-8227-34babddd1e3c","resolution":{"observed_at":"2026-08-06T22:44:43.754753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.759066Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.759066Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5f00a57f96350b731583a67ecd6814615b1f79fde72ab10a01a9b5b33f6cd915","observation_id":"7695e2b0-2af6-4ec2-a284-36335d8dfe45","resolution":{"observed_at":"2026-08-06T22:44:43.759066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.763474Z","title":"Bowman, Gabor Angeli, Christopher Potts, and Christopher D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.763474Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e29d8605ae7d9f2287c09e006ad3df6257b9702bf137da15f0bf57a1c1fd13f2","observation_id":"1afe4fb7-f00c-4da2-bf75-566cd5d388d2","resolution":{"observed_at":"2026-08-06T22:44:43.763474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.768026Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.768026Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ae28ef099408711adf6e9a51d3d3204fe3d9c8dde574ac2860619a9239c2076e","observation_id":"88dc5620-7baf-42b8-ba46-bec13b826d0b","resolution":{"observed_at":"2026-08-06T22:44:43.768026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.772139Z","title":"Semi-supervised semantic role labeling with cross-view training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.772139Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f5ef92ea03012160876594a4051980fc945f815d2f3688bee344cc502fd848e9","observation_id":"0ba7bc8b-8f5b-4ba0-aee8-fd2cf466cfaf","resolution":{"observed_at":"2026-08-06T22:44:43.772139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.777079Z","title":"Findings of the 2009 Workshop on Statistical Machine Translation","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.777079Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:355e2e45613a653bec748671c243dd4ac29c076b99b567879c9457c42807bcf7","observation_id":"e9b5ec18-87be-4a50-aaf6-7afa6c962e28","resolution":{"observed_at":"2026-08-06T22:44:43.777079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.781782Z","title":"Extracting training data from large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.781782Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1273c17e61b3f5a2d16cbbc99bb7b28d593d1e2a9700bad1907eda4d93345fd9","observation_id":"64557a6d-0750-4240-86e8-c773f78a6539","resolution":{"observed_at":"2026-08-06T22:44:43.781782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.790303Z","title":"SemEval-2017 task 1: Semantic textual similarity multilingual and crosslingual focused evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.790303Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:59982fa567a9c9050803af69a9f8f61b1a8d2a724ec4f20a9e56dcbeaed574bf","observation_id":"1dd787d0-4e16-421b-b31d-acd77c5e2bf0","resolution":{"observed_at":"2026-08-06T22:44:43.790303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.794286Z","title":"Importance of semantic representation: dataless classification","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.794286Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b1fa2043918a9279a8cb960335e7983e31a2865c85f916d9933ba908ace8a98e","observation_id":"f8595921-d963-4d70-9f72-775a66f409b4","resolution":{"observed_at":"2026-08-06T22:44:43.794286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.798701Z","title":"Semi-supervised BIBLIOGRAPHY 121 learning (chapelle, o","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.798701Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9defa68aa18ea759ea4535c09065a89a570cc4d76c945bbc233efc01caa3b66c","observation_id":"afb4a726-e2b8-409d-8cf9-fafd94f1b3db","resolution":{"observed_at":"2026-08-06T22:44:43.798701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.802803Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.802803Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e566d265ae9bda4e2af82584582490ab1aee28fa6c7fd23afda6b77e047ddc25","observation_id":"a6fe9601-807c-43b7-8236-ab98669c0721","resolution":{"observed_at":"2026-08-06T22:44:43.802803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.806846Z","title":"Debiased self-training for semi-supervised learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.806846Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:65f5b34816d05e02a97399cca9cf507628db5b31d00212a975e10361ed2f75d4","observation_id":"514b73ed-c09b-4d89-b55f-282201ca692b","resolution":{"observed_at":"2026-08-06T22:44:43.806846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.810858Z","title":"Unseen filler generalization in attention-based natural language reasoning models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.810858Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b5ee39006262549948bcf704c4a12232402affd60a9932cf889097127c519409","observation_id":"98443fdc-0446-422f-b965-4ec3a5b44748","resolution":{"observed_at":"2026-08-06T22:44:43.810858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.814900Z","title":"TOUCHDOWN: natural language navigation and spatial reasoning in visual street environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.814900Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e2c4e89ce70c540400dc86c185443c9aaafd99f568d6068b9708d2917651ee74","observation_id":"386a0536-a5ec-470d-b323-6eda5ce5e618","resolution":{"observed_at":"2026-08-06T22:44:43.814900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.818998Z","title":"MixText: Linguistically-informed interpolation of hidden space for semi-supervised text classification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.818998Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3fb8c2830ff50ee3fa1497fe624b25d26604e97cdc2be74287e5232810e45838","observation_id":"b962e938-27ce-4e8f-aa7c-9faf82ffd4e7","resolution":{"observed_at":"2026-08-06T22:44:43.818998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.823064Z","title":"Alpagasus: Training a better alpaca model with fewer data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.823064Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:2b0a18f770516a761694b212889993137d9541827269bb6e75a9c2930211b528","observation_id":"f9e4a0c8-d035-4a5e-88cc-d8cf8c5af729","resolution":{"observed_at":"2026-08-06T22:44:43.823064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T22:44:43.827536Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.827536Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:88b86335e5e348d96ec17737da07874066a8a96771249bb07f9ccfd12d8bd2f6","observation_id":"9c8fff1d-b1a5-4387-87e1-cd0d4ad17d28","resolution":{"observed_at":"2026-08-06T22:44:43.827536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T22:44:43.832810Z","title":"Microsoft coco captions: Data collection and evaluation server.ArXiv preprint, abs/1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.832810Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8725b8cc353004ce24d794122e10f91b9fee51a29405ba4ebf9cb4bbc53ae832","observation_id":"7f06129c-3df5-41a6-b17c-859f4f8c4064","resolution":{"observed_at":"2026-08-06T22:44:43.832810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.837349Z","title":"Adapt- ing language models to compress contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.837349Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:678e0878f86dc2abdda92af8823c9a31bf0a70a2bce1ac0c7c7e4fdb788bdd0a","observation_id":"4ceffca8-0791-4934-b47d-4c6d2435dd28","resolution":{"observed_at":"2026-08-06T22:44:43.837349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.845371Z","title":"Gonza- lez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.845371Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9326ec49f8170a269da0a2a52bca6c21f7f71836cd07b937bca9d2cca0692c25","observation_id":"fa025a4d-3938-4dc7-ae30-02f10aee1c4f","resolution":{"observed_at":"2026-08-06T22:44:43.845371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T22:44:43.849926Z","title":"Palm: Scaling language modeling with path- ways.ArXiv preprint, abs/2204.02311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.849926Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8de1c6d3381d1422c810e8764c403b1cf963c87b38de34c7d8516ece3b681d65","observation_id":"9c40c8b1-87b4-48d4-af4d-f8c49374f510","resolution":{"observed_at":"2026-08-06T22:44:43.849926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.854454Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.854454Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:38290f32769c231fa4ee46763f983a3306a763e531ffe82972c0020370d90454","observation_id":"45174e3b-1722-46a6-a373-2527451532a5","resolution":{"observed_at":"2026-08-06T22:44:43.854454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.858540Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.858540Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e7b6c1f310b14ada999c4fd79acf10abed12e19b8a45a2d16e478cb3922f73b2","observation_id":"d17e3aa2-e9d1-4863-9736-8477ecfe52a5","resolution":{"observed_at":"2026-08-06T22:44:43.858540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.863023Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.863023Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1a56f4a2d0f00a83d68f32ce34a59ee20dee7a67530318626be991173ce32b20","observation_id":"8acdc684-4fc2-4f76-b0dc-e2f9b1611de0","resolution":{"observed_at":"2026-08-06T22:44:43.863023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.867863Z","title":"Manning, and Quoc Le","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.867863Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:483adb29970a119dae6331e462d0919ee6115b64e8e1e0dd0d937be5517f862d","observation_id":"6e83cee6-2d08-4b0f-ba24-1a8539d6dc57","resolution":{"observed_at":"2026-08-06T22:44:43.867863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:44:43.871934Z","title":"Think you have solved ques- 124 BIBLIOGRAPHY tion answering? try arc, the ai2 reasoning challenge.ArXiv preprint, abs/1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.871934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:0b93fc849c50893a932d2b27bb61c98963ae997748970f07f22cd8dbd7d5da4d","observation_id":"b4666c98-7120-4c9d-be79-d49331aab7b6","resolution":{"observed_at":"2026-08-06T22:44:43.871934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.876140Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.876140Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e014ebb73752890244ad73707c8cb8f210e659092b0547e2c46e28175f44c597","observation_id":"6cacfbce-4e24-404a-956c-d73ec416b0ad","resolution":{"observed_at":"2026-08-06T22:44:43.876140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.880797Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.880797Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:57c8ecca2fbfaed8581a32a071dbd1e6990d3b6f291d895a5cf96dd1a39de82a","observation_id":"3dc26713-97e4-4cf2-bb77-6646961dcab3","resolution":{"observed_at":"2026-08-06T22:44:43.880797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.884647Z","title":"The PASCAL recog- nising textual entailment challenge","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.884647Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d9a3ea8257fe2760ea40e58a53d89a864d7c0872dc1c1f559790a7de63903ab6","observation_id":"4cd63697-8582-43e4-b949-2fed3f54d4b6","resolution":{"observed_at":"2026-08-06T22:44:43.884647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.888406Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.888406Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:03b750a0c21d3a038bd90d814ce68627304c4fa96c61d36c376341ea009d46e8","observation_id":"03f88398-73a0-4d54-85f4-752cafe668ed","resolution":{"observed_at":"2026-08-06T22:44:43.888406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.892250Z","title":"The commitmentbank: Investigating projection in naturally occurring discourse","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.892250Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:81733dfb7631f8f0b55fa870e37cd9b9a7a0a3125b6d5ff254bdfa6581e58d19","observation_id":"51c23cfc-d3dd-4812-8719-9751fa392809","resolution":{"observed_at":"2026-08-06T22:44:43.892250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.896950Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.896950Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:0c2fd841fa112fe60b3a4312c4dfc390b5071909d848bfd884389dc88aa56853","observation_id":"8cd2fcdd-14b9-44cc-bb5c-ffb64dc62880","resolution":{"observed_at":"2026-08-06T22:44:43.896950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.905116Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.905116Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:57a25aa114ea13ac70b60d52325be17c5c7b16396edc7dcdaa63e37fd09af67f","observation_id":"78874513-6b27-49cc-b158-b38ccc5f947a","resolution":{"observed_at":"2026-08-06T22:44:43.905116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08508","last_updated":"2021-10-26T15:55:56Z","snapshot_observed_at":"2026-08-08T04:03:14.126358Z","submitted_at":"2020-12-15T18:57:40Z","title":"Attention over learned object embeddings enables complex visual reasoning","version":3},"cited_work":{"arxiv_id":"2012.08508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.08508","snapshot_observed_at":"2026-08-06T22:44:45.596337Z","title":"Attention over learned object embeddings enables complex visual reasoning","venue":"cs.CV","work_id":"f7aee2c0-01bc-4749-bd1b-2a83897f9e68","year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.909542Z"},"links":{"cited_paper":"/paper/2012.08508","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7945f7228daaa0637702a9112a3d4a14ba257e0bcf9c7368a77101e4373d0f30","observation_id":"0f4a975a-d3e1-4246-83c7-65ffeddc1ea9","resolution":{"observed_at":"2026-08-06T22:44:45.601668Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.917917Z","title":"Dolan and Chris Brockett","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.917917Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d46fc00dc9fe50f557ad7bddc0bc33381cc17b498ee87deeeced50963480dc56","observation_id":"485d0deb-e583-40a7-b3aa-d221baf29a60","resolution":{"observed_at":"2026-08-06T22:44:43.917917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.921533Z","title":"A robust self-learning framework for cross- lingual text classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.921533Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:315b034c47d3d2cf6e56e107fa2b8ac92189e47429c2fb098cc18ca136df6119","observation_id":"c54d89f2-42da-4a6f-bc85-75bd718958c9","resolution":{"observed_at":"2026-08-06T22:44:43.921533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:44:43.925514Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.925514Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:da1f7309dd56d55653cbb819f8dbdbdd83909b5abe12346e9bd0cc595f486c6a","observation_id":"b1cf96da-04a9-4bfd-82c9-07bc2ef89990","resolution":{"observed_at":"2026-08-06T22:44:43.925514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05179","last_updated":"2017-06-11T11:51:06Z","snapshot_observed_at":"2026-08-08T08:03:26.866593Z","submitted_at":"2017-04-18T02:42:17Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05179","snapshot_observed_at":"2026-08-06T22:44:43.929753Z","title":"Searchqa: A new q&a dataset augmented with context from a search engine.ArXiv preprint, abs/1704.05179, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.929753Z"},"links":{"cited_paper":"/paper/1704.05179","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b0fb1959ebc1a9f56b447718a3d947dffa159128abdfebcd3935f2187f8ed59a","observation_id":"454af4f4-62f4-4af8-bcea-b3ab0bf330a0","resolution":{"observed_at":"2026-08-06T22:44:43.929753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.934143Z","title":"MRQA 2019 shared task: Evaluating generalization in reading com- prehension","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.934143Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8eb2b81b44e3ef72e689ad354053bf967a0e409d60e7b9e8fa3f6ea8117139d4","observation_id":"ca3c2e8d-9098-4958-a20d-fb04887dc98f","resolution":{"observed_at":"2026-08-06T22:44:43.934143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.938432Z","title":"Making pre-trained language models better few-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.938432Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a672bbc0cfdbb5a96a12b8b8573e785df4200b414ca04f31f946e4690e2d6ee6","observation_id":"51d56377-32f5-4d7f-9ec8-b748e575d177","resolution":{"observed_at":"2026-08-06T22:44:43.938432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.943172Z","title":"Zero-shot text classification with self-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.943172Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:470bc564d45917dde0ebb83fa35a9bbec7aeacb9323bff5b78eb3299ff24a32d","observation_id":"fd02e4cf-c60f-4c36-9207-7682117dccb2","resolution":{"observed_at":"2026-08-06T22:44:43.943172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.951585Z","title":"The third PASCAL recognizing textual entailment challenge","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.951585Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:eedf031745471adb8a7fb86009b540e9582aeceb98e65c17bf601b98d32e2cbd","observation_id":"f6a792ca-a239-401e-8b3e-020e0c206176","resolution":{"observed_at":"2026-08-06T22:44:43.951585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10836","last_updated":"2022-01-26T09:31:55Z","snapshot_observed_at":"2026-08-13T16:53:02.526585Z","submitted_at":"2022-01-26T09:31:55Z","title":"PARS: Pseudo-Label Aware Robust Sample Selection for Learning with Noisy Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10836","snapshot_observed_at":"2026-08-06T22:44:43.955463Z","title":"Pars: Pseudo-label aware robust sample selection for learning with noisy labels.ArXiv preprint, abs/2201.10836, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.955463Z"},"links":{"cited_paper":"/paper/2201.10836","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:220d8d2dc5515531de98404d5aea3a7f2fe2776caa000ab8ff75d7abc8852301","observation_id":"dc6b9d1b-277a-4708-9c8f-73a7cb4f0847","resolution":{"observed_at":"2026-08-06T22:44:43.955463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.960188Z","title":"Making the V in VQA matter: Elevating the role of image under- standing in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.960188Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:cf1772867534583c67bce44892f3eacd7ef1dbc70cf6acaf2b404a802b36a1fa","observation_id":"a6e7cd32-27b4-4356-92b5-47c15418a18c","resolution":{"observed_at":"2026-08-06T22:44:43.960188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.964317Z","title":"Semi-supervised learning by en- tropy minimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.964317Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8873345f3adfb0f1d2782ab60751805b845301374530357733a56a49dbb09df3","observation_id":"5f8850c1-6ad4-47e1-80d6-487256dba4e4","resolution":{"observed_at":"2026-08-06T22:44:43.964317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.968612Z","title":"Projected language models: A large model pre-segmented into smaller ones","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.968612Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a35090f4d62f6a27e7cc01cdb89b07830e50b94c6deea08de6ac264cd78c908d","observation_id":"ef3006f6-2adf-47dd-bd74-2b0d2a27595b","resolution":{"observed_at":"2026-08-06T22:44:43.968612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.973015Z","title":"PPT: Pre-trained prompt tuning for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.973015Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3f32bb20164886f88b479787f702e0736950f44cfc591bc3ea77ef66b187f3f8","observation_id":"c06839e4-2587-4c38-9d9d-19c58db54669","resolution":{"observed_at":"2026-08-06T22:44:43.973015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T22:44:43.977337Z","title":"Textbooks are all you need.ArXiv preprint, abs/2306.11644, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.977337Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:83f74d7fc737d5d81ee3f2d86bfaf333944e704833055ea58ce15d5529ec96ff","observation_id":"bde65ae0-cc71-4d47-93ad-2d76f9fad05d","resolution":{"observed_at":"2026-08-06T22:44:43.977337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.982011Z","title":"Parameter-efficient transfer learning with diff pruning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.982011Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:29885e740e100113802043026b4ea1b0b4941cd1d667bd9949c71855f70a83d8","observation_id":"8535b9b1-5e36-4d82-a403-de8ddcb09be5","resolution":{"observed_at":"2026-08-06T22:44:43.982011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.986757Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.986757Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1917768bfdcbdc6875e6631382e639401399e17cb0c23d19191677b6b2823461","observation_id":"24285ebd-c1ae-4116-b986-77a679a384a9","resolution":{"observed_at":"2026-08-06T22:44:43.986757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.990606Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.990606Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ca3663d82875275266e6adfb8b88b18c0e15404b3061863dc09627eeb35c872e","observation_id":"15de1586-1f21-4d33-b0fe-9ee0b4185d74","resolution":{"observed_at":"2026-08-06T22:44:43.990606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.994748Z","title":"W ARP: Word-level Adversarial ReProgramming","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.994748Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:67524ce9af1effbbd25752138bcdc82d991d80d9c0cc6453f6253c166f76b1a1","observation_id":"f05badb1-233e-40c7-a630-7b8038610c34","resolution":{"observed_at":"2026-08-06T22:44:43.994748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.998737Z","title":"ToxiGen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.998737Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ef63c5e6c33ea144bd904b5986151741847642600a0280db5b67baad7f9d7114","observation_id":"8a42452f-7e20-4234-834c-93aef0b19e51","resolution":{"observed_at":"2026-08-06T22:44:43.998737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19249","last_updated":"2023-05-30T17:35:31Z","snapshot_observed_at":"2026-08-13T11:29:11.255335Z","submitted_at":"2023-05-30T17:35:31Z","title":"Preserving Pre-trained Features Helps Calibrate Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19249","snapshot_observed_at":"2026-08-06T22:44:44.002754Z","title":"Preserving pre-trained features helps calibrate fine-tuned language models.ArXiv preprint, abs/2305.19249, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.002754Z"},"links":{"cited_paper":"/paper/2305.19249","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:73a0b50b81b750582ee925404c21eb464580818028c7c5cad082bf97a55634d6","observation_id":"508e78f9-fa73-48d0-9ba2-bb3920c27b89","resolution":{"observed_at":"2026-08-06T22:44:44.002754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.007546Z","title":"Extending clip for category-to-image re- trieval in e-commerce","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.007546Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:28f29e643d9984eb990b8143e8f1ad1194e3076c51d1366a8983345df7e162c1","observation_id":"96c7696e-858c-4660-95cc-c48eda6dea5a","resolution":{"observed_at":"2026-08-06T22:44:44.007546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.011271Z","title":"Aligning AI with shared human values","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.011271Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:40eb9506e984c097f7d6e8ca1ab955c794449a9281ec8e5b859e8a1573cf63c7","observation_id":"1d7566e4-c94a-455d-bd00-0ed6b9d6eacb","resolution":{"observed_at":"2026-08-06T22:44:44.011271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.015165Z","title":"Measuring massive multitask language BIBLIOGRAPHY 129 understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.015165Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:6263a2496393fe3befcb06b6218a337e957daef342d4d309c9294bbd377cb304","observation_id":"2c76dce9-fa76-4d1c-be3a-ab352787a12d","resolution":{"observed_at":"2026-08-06T22:44:44.015165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T22:44:44.019604Z","title":"Training compute-optimal large language models.ArXiv preprint, abs/2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.019604Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c98b41a52b0bf25477beaf4afd328db9f5babff3fd8c36ca2be8638a6af39f5e","observation_id":"1212c0c6-a34c-4ad7-af8c-050bec2fc8b1","resolution":{"observed_at":"2026-08-06T22:44:44.019604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-13T04:59:53.332269Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-06T22:44:44.024618Z","title":"Orpo: Monolithic preference optimization without reference model.arXiv preprint arXiv:2403.07691, 2(4):5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.024618Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:cf09f048e64518d2d7950a4198c436468fc003d636691cc9a31558e56470e295","observation_id":"89b04e8d-6a7f-4972-bd88-348b7ab06d90","resolution":{"observed_at":"2026-08-06T22:44:44.024618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.028585Z","title":"Unnatural in- structions: Tuning language models with (almost) no human labor","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.028585Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:776eacc3adcbd6638573558a8f50f1ff8f7b164c54f1811213e9a51d3f48b577","observation_id":"387cd108-173b-488f-896a-efb847a5ec91","resolution":{"observed_at":"2026-08-06T22:44:44.028585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.032574Z","title":"Human feedback is not gold standard","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.032574Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:58c155b5b1644b2973a9879dec271f1c6dc0464ae03b0c206ac991b2b81147f7","observation_id":"6591317c-b6fe-468d-bda6-ec2fe5272144","resolution":{"observed_at":"2026-08-06T22:44:44.032574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.036748Z","title":"Meta-learning the differ- ence: Preparing large language models for efficient adaptation.Transactions of the Association for Computational Linguistics, 10:1249–1265, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.036748Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:4b35f6a44d6084b273d4bf63536c1d4419bf93b2cdc0492aa40dffee45e1558c","observation_id":"d5c18acf-5c37-48fc-80c6-da3486230df3","resolution":{"observed_at":"2026-08-06T22:44:44.036748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.040532Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.040532Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c4c8c7a8fd6dd2c201882989c05c96dac68033c3330685e5c518b9b645240c99","observation_id":"972d2f27-166c-4da7-8008-730a3bac1ee1","resolution":{"observed_at":"2026-08-06T22:44:44.040532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.044640Z","title":"Universal language model fine-tuning for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.044640Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:06d94d8c1b5cb04f14d8a56fbc288281f664afd0f6910026ed14e212edca562a","observation_id":"87491cae-c3a0-4940-a3b9-7ac4efb15e71","resolution":{"observed_at":"2026-08-06T22:44:44.044640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.049025Z","title":"Can llms learn from a single exam- ple?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.049025Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3716f04ec007a0e35e8f0de2215f162bb4c93758d10e622b29963fc5dcd30df0","observation_id":"c159ef43-dec7-4a8d-a25c-16cd0d11e52c","resolution":{"observed_at":"2026-08-06T22:44:44.049025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.053093Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.053093Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e716c9b29f8cf0fa2f01b07654b0bf860992c1a383bc7aa777baca008748b3ee","observation_id":"070e5a04-10ca-489b-9f45-84d6e79b27f5","resolution":{"observed_at":"2026-08-06T22:44:44.053093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.057136Z","title":"Mining and summarizing customer reviews","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.057136Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:fe3e3293d151c323fade91b40adc9d812f32bf7638a10264b2f7a543720bbf06","observation_id":"0fe4b3bd-abe6-48bc-8d52-5a324ea9b841","resolution":{"observed_at":"2026-08-06T22:44:44.057136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.061742Z","title":"Instruction fine-tuning: Does prompt loss mat- ter?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.061742Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:aa03803f27bccba4e9305dc774f12c9ff5bfe005f81565fd72458a311486fbfa","observation_id":"f5bda0a5-dc72-4678-a121-4455a329f013","resolution":{"observed_at":"2026-08-06T22:44:44.061742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-13T00:51:41.824778Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T22:44:44.066010Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conver- sations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.066010Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:212f955e1ed3291c4ed7934ff03b794ce5ce76c8ace4f03e4c2fd13563d975b6","observation_id":"8bb9cdef-5d9f-4a89-bffc-0f18e730a2b8","resolution":{"observed_at":"2026-08-06T22:44:44.066010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.070392Z","title":"Hyperdecoders: Instance-specific de- coders for multi-task NLP","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.070392Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1966d258d39ea8c61cb140305102b50d49f1eff0b94ac385508600b15cef2baa","observation_id":"8fc32d23-017b-4d41-aa13-4f3505d20fe2","resolution":{"observed_at":"2026-08-06T22:44:44.070392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.074811Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.074811Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:072f2943f685f3e5c62062bf62c9300390cfef63aab7d377c3b9907b064a6ec7","observation_id":"03ee083b-576c-4b2a-9424-5ee6b357137d","resolution":{"observed_at":"2026-08-06T22:44:44.074811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.079269Z","title":"Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Aniruddha Saha, Micah Goldblum, Jonas Geiping, and Tom Goldstein","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.079269Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:2359eaf94c7418b6e38c36f25eaaf647d3e331f1748a01f7331822a4c83cbe36","observation_id":"d50d8371-1ccb-4c20-b3e7-6f0c7d166ac6","resolution":{"observed_at":"2026-08-06T22:44:44.079269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.083308Z","title":"Representation learning for grounded spatial reasoning.Transactions of the Association for Computational Linguistics, 6:49–61, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.083308Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3dd88353519eaa32cd815f468b2765c64d3d86496519037c1415cdfc469f3ca2","observation_id":"fa6bd133-d5a4-4ccc-ac10-fbff2c2ca7c9","resolution":{"observed_at":"2026-08-06T22:44:44.083308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13133","last_updated":"2023-11-22T03:37:01Z","snapshot_observed_at":"2026-08-13T05:19:58.220363Z","submitted_at":"2023-11-22T03:37:01Z","title":"LIMIT: Less Is More for Instruction Tuning Across Evaluation Paradigms","version":1},"cited_work":{"arxiv_id":"2311.13133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13133","snapshot_observed_at":"2026-08-06T22:44:45.460894Z","title":"LIMIT: Less Is More for Instruction Tuning Across Evaluation Paradigms","venue":"cs.LG","work_id":"c08a7774-68b5-45d7-8e7a-53ef9695c5de","year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.087462Z"},"links":{"cited_paper":"/paper/2311.13133","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9c8a8703d65471826a154ee2801cb97b7d897dd70452b10f2f4bd9100c48f126","observation_id":"452c341f-57e9-48ef-aed8-cb4f10f2dc73","resolution":{"observed_at":"2026-08-06T22:44:45.465717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:44:44.091445Z","title":"Scaling laws for neural language models.ArXiv preprint, abs/2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.091445Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:dc4b2b61a9f6ac705695df0a59cd1964181c8e15de8a49f63c4c94f68215d43f","observation_id":"013171b2-3b55-4642-b22c-d29254e49371","resolution":{"observed_at":"2026-08-06T22:44:44.091445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.095688Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.095688Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d59cf62b829937c7a72e4b4a888e436d47a185d526d59458ab16c8fe7b08fc0e","observation_id":"58e56958-bd20-4f8c-aa66-aac08c5718fb","resolution":{"observed_at":"2026-08-06T22:44:44.095688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.099652Z","title":"Looking beyond the surface: A challenge set for reading compre- hension over multiple sentences","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.099652Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8450007794ef7a61c368b6d4c2df12b2cd12423e5a4aa76d7a5f03a498e260ec","observation_id":"df9ceb9b-f737-4228-b364-74eb76ee197b","resolution":{"observed_at":"2026-08-06T22:44:44.099652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.103686Z","title":"UNIFIEDQA: Crossing for- mat boundaries with a single QA system","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.103686Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c35bd560a9a379858a2cc85c89ec5c3a33085ce78cc584805602fc04110284a7","observation_id":"418a7124-be8a-43ae-a98a-c33d2d53fdeb","resolution":{"observed_at":"2026-08-06T22:44:44.103686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.107619Z","title":"Scitail: A textual entail- ment dataset from science question answering.Proceedings of the AAAI Conference on Artificial Intelligence, 32(1), Apr","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.107619Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:4deb71cf02d99909042f9b1c4007060e4a76645c97806b9d980693fa45a30eac","observation_id":"e69bab42-9f29-4524-b3f9-ec54819353d3","resolution":{"observed_at":"2026-08-06T22:44:44.107619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T20:19:45.646045Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":98,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":277},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 277 outbound references and 0 inbound Pith citation observations for arXiv:2506.20917."}