{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:7MB4UJDBVWSXDU45YPCYXXRI77","short_pith_number":"pith:7MB4UJDB","schema_version":"1.0","canonical_sha256":"fb03ca2461ada571d39dc3c58bde28ffd080e72cd16f21233b12591e3a4dc0a7","source":{"kind":"arxiv","id":"2405.07745","version":1},"attestation_state":"computed","paper":{"title":"LlamaTurk: Adapting Open-Source Generative Large Language Models for Low-Resource Language","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Cagri Toraman","submitted_at":"2024-05-13T13:41:59Z","abstract_excerpt":"Despite advancements in English-dominant generative large language models, further development is needed for low-resource languages to enhance global accessibility. The primary methods for representing these languages are monolingual and multilingual pretraining. Monolingual pretraining is expensive due to hardware requirements, and multilingual models often have uneven performance across languages. This study explores an alternative solution by adapting large language models, primarily trained on English, to low-resource languages. We assess various strategies, including continual training, i"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.07745","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2024-05-13T13:41:59Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"69b10ad064fb7fe49228cfd6c6d63c1d696e1479d745b2a3c9790137066b6efa","abstract_canon_sha256":"070898939c5f22d86371e876997e0d5d7e255bc6d80467f600529d4a501ba1a7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:18:27.080809Z","signature_b64":"k7UFu1UWWFsLArTvGCHxGWJ1X+MPHw2A0C7bXwqR63uDENcDYrR45KB/rrE/wIgR946NiVs/nREovhQqLoyJCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fb03ca2461ada571d39dc3c58bde28ffd080e72cd16f21233b12591e3a4dc0a7","last_reissued_at":"2026-07-05T08:18:27.080416Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:18:27.080416Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LlamaTurk: Adapting Open-Source Generative Large Language Models for Low-Resource Language","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Cagri Toraman","submitted_at":"2024-05-13T13:41:59Z","abstract_excerpt":"Despite advancements in English-dominant generative large language models, further development is needed for low-resource languages to enhance global accessibility. The primary methods for representing these languages are monolingual and multilingual pretraining. Monolingual pretraining is expensive due to hardware requirements, and multilingual models often have uneven performance across languages. This study explores an alternative solution by adapting large language models, primarily trained on English, to low-resource languages. We assess various strategies, including continual training, i"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.07745","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.07745/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.07745","created_at":"2026-07-05T08:18:27.080476+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.07745v1","created_at":"2026-07-05T08:18:27.080476+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.07745","created_at":"2026-07-05T08:18:27.080476+00:00"},{"alias_kind":"pith_short_12","alias_value":"7MB4UJDBVWSX","created_at":"2026-07-05T08:18:27.080476+00:00"},{"alias_kind":"pith_short_16","alias_value":"7MB4UJDBVWSXDU45","created_at":"2026-07-05T08:18:27.080476+00:00"},{"alias_kind":"pith_short_8","alias_value":"7MB4UJDB","created_at":"2026-07-05T08:18:27.080476+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2507.09205","citing_title":"From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06202","citing_title":"Cross-Lingual Transfer and Parameter-Efficient Adaptation in the Turkic Language Family: A Theoretical Framework for Low-Resource Language Models","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77","json":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77.json","graph_json":"https://pith.science/api/pith-number/7MB4UJDBVWSXDU45YPCYXXRI77/graph.json","events_json":"https://pith.science/api/pith-number/7MB4UJDBVWSXDU45YPCYXXRI77/events.json","paper":"https://pith.science/paper/7MB4UJDB"},"agent_actions":{"view_html":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77","download_json":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77.json","view_paper":"https://pith.science/paper/7MB4UJDB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.07745&json=true","fetch_graph":"https://pith.science/api/pith-number/7MB4UJDBVWSXDU45YPCYXXRI77/graph.json","fetch_events":"https://pith.science/api/pith-number/7MB4UJDBVWSXDU45YPCYXXRI77/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77/action/storage_attestation","attest_author":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77/action/author_attestation","sign_citation":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77/action/citation_signature","submit_replication":"https://pith.science/pith/7MB4UJDBVWSXDU45YPCYXXRI77/action/replication_record"}},"created_at":"2026-07-05T08:18:27.080476+00:00","updated_at":"2026-07-05T08:18:27.080476+00:00"}