{"as_of":"2026-08-10T00:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03426810c979a91ba0fb4668416955defc04508d7e7710ff1ec7a9d34ed00896","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:36:28.735305Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18413/citation-record","integrity":"/paper/2505.18413/integrity","json":"/paper/2505.18413/citation-record.json","paper":"/paper/2505.18413"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:36:25.282246Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.282246Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:5895431e51385fd6cf5c2ddf78ab93d1e62f172333aeb788368de6f5383a49a9","observation_id":"c2c06224-b566-46f9-b865-6b7bff397c7b","resolution":{"observed_at":"2026-08-07T14:36:25.282246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-03T07:09:22.905094Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-07T14:36:25.329311Z","title":"Beyond efficiency: A systematic survey of resource-efficient large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.329311Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:5a85260b7ef86eaba2901fc85ca431f87be7cc5411dbdc62b2a3fbbc242b203f","observation_id":"d1deea97-6f15-4f39-bd23-c5e60d46039f","resolution":{"observed_at":"2026-08-07T14:36:25.329311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.764007Z","title":"SparseLLM: Towards global pruning of pre-trained language models","venue":null,"work_id":"bac9cc0f-1470-4765-bba7-6755d8c9ec82","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.417910Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:205a47638b66b2a6ac8a66f96565e99aa0cbec666ac65b555bb72c413e93fa92","observation_id":"1db0197c-8592-47b0-aec6-67b04e4343ce","resolution":{"observed_at":"2026-08-07T14:36:32.810350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T14:36:25.480363Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.480363Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:d3fd9e845292509330663cb0f2dcfb8c4dc493ff28b9bd75a537a324330140a6","observation_id":"c685ec87-3a1c-4d35-81be-3caa902f11fe","resolution":{"observed_at":"2026-08-07T14:36:25.480363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T14:36:25.552150Z","title":"Palu: Compressing KV-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.552150Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:58ac6f2dc0129d4090b1b8508851bdede849e55597415a57cd8695b9d86d9e07","observation_id":"de377a09-f03b-457f-b1bd-0eb0dffa5fe3","resolution":{"observed_at":"2026-08-07T14:36:25.552150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-07T14:36:25.615439Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.615439Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:811e424e9f0b852b118cb943a228ec8a67591b0fabe8bfd3f8ae9aa28c5c4214","observation_id":"240a159d-da0c-4316-a833-afe69cfeaab9","resolution":{"observed_at":"2026-08-07T14:36:25.615439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.625426Z","title":null,"venue":null,"work_id":"615ef4e6-0a28-4b8b-a13c-b14d64ec163e","year":2025},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.680177Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:370730c3befd566dbe53ae361367d57d806b22188f9df896efc4dc5578d9f5a4","observation_id":"11f4e7c6-8291-44ca-814d-f623ae7e283f","resolution":{"observed_at":"2026-08-07T14:36:32.681512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.489602Z","title":"Exploiting linear structure within convolutional networks for efficient evaluation","venue":null,"work_id":"fcab1019-63dc-4fef-b4bc-a4a1f2871d45","year":2014},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.755262Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:4d3bd910fc2742cba969427b2ac5707b7ccb842233649f0b2882b9d44af5249f","observation_id":"17241804-7cb0-4bec-a9e8-0a2140aa1046","resolution":{"observed_at":"2026-08-07T14:36:32.559494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.284785Z","title":"The case for 4-bit pre- cision: k-bit inference scaling laws","venue":null,"work_id":"6f1c23d2-a7bb-43fb-8777-1042b66d2e10","year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.838247Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:afc5c0082e836a378696c925009c95b7003f895925f28618caf8d3e43a9f80ab","observation_id":"bac52161-ec82-4edd-92f7-0ab3091b3fd8","resolution":{"observed_at":"2026-08-07T14:36:32.368879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.163027Z","title":"SparseGPT: Massive lan- guage models can be accurately pruned in one-shot","venue":null,"work_id":"ce77c0fc-80a6-4718-a0c1-bbc8d418b449","year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.901574Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:1eacc2671772bd94a6eed54adbdbad2d603be9bb7a6c63c73e18a493b207b0f8","observation_id":"0ea253db-e85d-4860-8d87-befe9b60dc66","resolution":{"observed_at":"2026-08-07T14:36:32.224670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:36:25.988734Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:25.988734Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:901ec11734edd4fa5d318ec6ebfd7cb9a2cd5688770319892895bc0842a45eec","observation_id":"0b19b3af-67d6-45e6-a5cb-488ffefaae87","resolution":{"observed_at":"2026-08-07T14:36:25.988734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:32.037174Z","title":"Optimal brain surgeon and general network pruning","venue":null,"work_id":"4d07d8db-6d1a-4b91-9007-18314e3ccdf5","year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.071748Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:61eb83307bf375215e2fbd385a05ddbcfe4ecbed9109fbc8a881ba6456e68b1e","observation_id":"7d4e12b9-8b99-4d64-ad86-811e24049369","resolution":{"observed_at":"2026-08-07T14:36:32.103562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-07T14:36:26.140525Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.140525Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:c604953858616fb97a9be87bbcbf97a6d3b76fcbe45dba68ab4f62014af5eba8","observation_id":"8504ecd0-91f8-41a5-be47-075d2c859709","resolution":{"observed_at":"2026-08-07T14:36:26.140525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09117","last_updated":"2024-06-13T13:44:31Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T13:44:31Z","title":"PC-LoRA: Low-Rank Adaptation for Progressive Model Compression with Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09117","snapshot_observed_at":"2026-08-07T14:36:26.200703Z","title":"PC-LoRA: Low-rank adaptation for progressive model compression with knowledge distilla- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.200703Z"},"links":{"cited_paper":"/paper/2406.09117","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:159f929944ead7e15b9334198fa6ac8e77372a50a590a27d3236b9d58b51cb35","observation_id":"14c94767-f9f5-4430-826a-5038496469c3","resolution":{"observed_at":"2026-08-07T14:36:26.200703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T14:36:26.273603Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.273603Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:098139a04e1f40d9024ac474c63eddf8ce4d586bf47fbc3a11845abc506dde38","observation_id":"0d8671d7-b1bf-4560-af95-bd7dceed05d2","resolution":{"observed_at":"2026-08-07T14:36:26.273603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.910728Z","title":"GPT-4 passes the bar exam","venue":null,"work_id":"c2acd0f0-c3a0-4c0c-9349-628d98c7360b","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.350686Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:a0042f3770fe7f0f6104918f372d85e384f714b61b9001378b75121e99c127a3","observation_id":"77f00abf-534c-48e9-ad7d-16d00534f531","resolution":{"observed_at":"2026-08-07T14:36:31.978651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.766020Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"62a5db73-b25c-4aca-bb60-7e5bd1f5bd49","year":2019},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.436078Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:69330fd472dbcf3f3e925cb6a47e5c872fa6913ce7521b14c914eedf509cbbf3","observation_id":"8145a8c0-1983-4bed-8c60-c98ed18a1a49","resolution":{"observed_at":"2026-08-07T14:36:31.835035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.642669Z","title":"Optimal brain damage","venue":null,"work_id":"9488d8a3-c66d-4289-a934-83717456c411","year":1989},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.521191Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:7bb87a3536f3ec8521017a4f891d1f87bc99af66c11c7adf0292b7e789d6fab6","observation_id":"7bd49f21-f817-4a6b-bc8a-ebab02acf37c","resolution":{"observed_at":"2026-08-07T14:36:31.720301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.478651Z","title":"A well-conditioned esti- mator for large-dimensional covariance matrices","venue":null,"work_id":"45197323-c506-49c4-b6b7-a591e2d9b74f","year":2004},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.585546Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:6d532146c21d91d24bb33d9b77660feaf65f749031aacb9911fb65879dca99f1","observation_id":"1071d354-ec1c-47bb-94bb-f113775a96b0","resolution":{"observed_at":"2026-08-07T14:36:31.559064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.305384Z","title":"LoSparse: Structured com- pression of large language models based on low-rank and sparse approximation","venue":null,"work_id":"712abb75-d14d-4236-936f-052fa1217117","year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.683173Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:481a4796e0633eec24a9dcd11317e65b4e4a7390e16cf8cf1eb7d44b0e9cdd7e","observation_id":"583760f6-b70a-42c5-9c3a-8afa8482b7b6","resolution":{"observed_at":"2026-08-07T14:36:31.384050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11261","last_updated":"2025-02-26T18:44:29Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T04:35:56Z","title":"Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix","version":2},"cited_work":{"arxiv_id":"2410.11261","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11261","snapshot_observed_at":"2026-08-07T14:36:28.975399Z","title":"Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix","venue":"cs.LG","work_id":"9a5542a0-2124-4b0c-b285-f2794ef5a535","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.765346Z"},"links":{"cited_paper":"/paper/2410.11261","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:088970d88a2c00c6b6e4b7d3f61c04f95caa9b3fe1ddc4ef78280c5b0cd91abb","observation_id":"a6740093-4468-4bfb-98e9-ea5c20b7031a","resolution":{"observed_at":"2026-08-07T14:36:29.038387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T14:36:26.860447Z","title":"MoE-LlaVa: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.860447Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:7921e69c9256a91df28a32fa0b48be89e9c7beef9784f0eb996ac44de7de8ade","observation_id":"4ebe3966-64f4-492c-a488-b3e3cf0c3119","resolution":{"observed_at":"2026-08-07T14:36:26.860447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.153114Z","title":"AWQ: Activation-aware weight quantization for on-device LLM compression and accelera- tion","venue":null,"work_id":"0c33b465-8b18-4205-828e-1bf1487286b5","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:26.946648Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:3012dc2c3b33c5925c9d4af6f250eebbc48e5de372ee7eda450b8f1863ea585a","observation_id":"a7ad3544-b528-4917-b96a-df0dcc96819b","resolution":{"observed_at":"2026-08-07T14:36:31.213947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:36:27.024844Z","title":"DeepSeek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.024844Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:746eed48b65dcd2fa885ab89488b39f68bd212c7ec96d49feb7c89f178658a94","observation_id":"8284d0aa-2043-4fd3-a339-1ebdb6dd188f","resolution":{"observed_at":"2026-08-07T14:36:27.024844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:31.015342Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"50760113-7cbc-4557-ab83-0b8fb03c3f3f","year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.087720Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:a5ea3c397e4e8d6c4cf4f3551b9de4e5592a34a23c76d3b080ad313ef55dc7bc","observation_id":"e634fac1-8581-4ad3-b278-992e3eb03c67","resolution":{"observed_at":"2026-08-07T14:36:31.089171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.888430Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"4890552c-78f5-4f2e-83b7-ebfb539d7dab","year":2022},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.150867Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:b7ee1ddc873df4c8562f068746eaf2773ef013e55c90e08adb8c1c3f4827a02e","observation_id":"d47d09b3-8be8-4d51-87c8-b0a01a197364","resolution":{"observed_at":"2026-08-07T14:36:30.921460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.734047Z","title":"The penn treebank: Annotating pred- icate argument structure","venue":null,"work_id":"1e363cf6-2a7a-4d03-82e0-0b7c19805b85","year":1994},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.221411Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:b7af65ff4e45623652926e41a4c3fc03e13f3faa505ad94403f9133517cf9bc3","observation_id":"932a920d-14f5-4e6d-9c14-3e22c81754f0","resolution":{"observed_at":"2026-08-07T14:36:30.811173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T14:36:27.293105Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.293105Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:bd08a59564555f0b57fec117a36f073300941f253749bfd70b875826b162e3fb","observation_id":"cf4e8bf6-d8af-4ab3-bd6f-b2f5d8778f46","resolution":{"observed_at":"2026-08-07T14:36:27.293105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.582416Z","title":"PyTorch: An imperative style, high-performance deep learning li- brary","venue":null,"work_id":"e618943a-d077-442b-a3cd-fbebc887773a","year":2019},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.355659Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:db3494c851b369065191363118821f779c1cf0f15c219fddbfa9e4eed67a11d7","observation_id":"47530378-0076-485c-a6a3-5bafe57adec1","resolution":{"observed_at":"2026-08-07T14:36:30.655344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.479496Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"425f9062-cfd2-44a2-bd56-e00fd2d0fa84","year":2018},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.437977Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:7c2e5a8bc60843bb85aee5f90caf5b360b9dd0b69b0f0e1ae2a9fff32f96e8d7","observation_id":"e5a97581-de30-45d0-8164-2ca0c1fb69ae","resolution":{"observed_at":"2026-08-07T14:36:30.541603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.313577Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"e5b327e4-28ef-4ead-b186-d189f9c05379","year":2020},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.503103Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:fb8a52b33c3c208e74432078165e7c871e3febba08732eb2437e5e484b573b33","observation_id":"ded2fb4a-2627-4b35-b587-87a07647adc0","resolution":{"observed_at":"2026-08-07T14:36:30.403281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.140192Z","title":"Compressing large language models using low rank and low precision decomposition","venue":null,"work_id":"baf08e97-08ab-45f6-917d-29cbfeeaa325","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.600397Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:b49025c5cb9de8560db6f380c201d9111c974697ac07fc8c52166d4d5e000d11","observation_id":"308176fb-f749-456e-b4df-b5e993404494","resolution":{"observed_at":"2026-08-07T14:36:30.218568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:30.009632Z","title":"Low-rank matrix factorization for deep neural network training with high- dimensional output targets","venue":null,"work_id":"d5ffb6f0-9ae4-4005-8fb8-5b6eabe00b24","year":2013},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.683165Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:4e1b76ee80f01940b5adae06ad19f1343c926a8bc9ff4d434b18ee2d45272328","observation_id":"81cb0c3b-46dc-41a3-88f7-f9d8c5d4fcb3","resolution":{"observed_at":"2026-08-07T14:36:30.045542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05646","last_updated":"2024-11-08T16:29:33Z","snapshot_observed_at":"2026-08-09T17:23:55.704481Z","submitted_at":"2024-08-10T22:47:12Z","title":"Eigen Attention: Attention in Low-Rank Space for KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05646","snapshot_observed_at":"2026-08-07T14:36:27.748100Z","title":"Eigen attention: Attention in low- rank space for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.748100Z"},"links":{"cited_paper":"/paper/2408.05646","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:b73ba0e134702ebb8021505637a0932317cacd3d42865f9ccf173810651e1715","observation_id":"508cc0d9-098f-4f60-b8ab-01ccc9a87c36","resolution":{"observed_at":"2026-08-07T14:36:27.748100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.863064Z","title":"Low-rank lottery tick- ets: finding efficient low-rank neural networks via matrix differential equations","venue":null,"work_id":"99f92010-e2ff-4ff6-9aad-903e0ddd3ea3","year":2022},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.790671Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:d310d49fd148b5c255bc33380fafb95a5cb5154821ca2651625873fdf362bc77","observation_id":"20dda85b-cc72-4e9e-9352-e82849ede1a5","resolution":{"observed_at":"2026-08-07T14:36:29.922562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.743628Z","title":"Green AI","venue":null,"work_id":"f911b183-a1c3-47a9-8a4d-3a778dec5935","year":2020},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.854801Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:7845c8fac08ba5a1dd58e9f27ac9c4e7f314412334d50471ec2ce8d1b284d026","observation_id":"2ec3fa6e-c35f-458c-951c-7b43c5e80af2","resolution":{"observed_at":"2026-08-07T14:36:29.800985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:27.942579Z","title":"RoFormer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.942579Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:7af59ce6393ec3f62ab77fdc24231c25bb22b0fc5e9c633d82ce6bb85743ab33","observation_id":"5e7a8c2e-c841-4268-b95a-cabab14488f8","resolution":{"observed_at":"2026-08-07T14:36:27.942579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T14:36:27.999333Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:27.999333Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:265f0e3473c1d4331e63c2826de1c9ad4fa44007e8ebda3ffe3b60263bb6b096","observation_id":"18f6aca1-b490-41b1-aa38-f50ef6ff4c85","resolution":{"observed_at":"2026-08-07T14:36:27.999333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:36:28.069833Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.069833Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:3083e2e119914a15724ccc7f75c7e01067e9b1360ae6241ca7411815ccc6c2b6","observation_id":"4c43f400-fd57-4aa1-8161-ce727b13c736","resolution":{"observed_at":"2026-08-07T14:36:28.069833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-07T14:36:28.109772Z","title":"Q-VLM: Post-training quanti- zation for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.109772Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:8e9a8a0ff68b602d4903784e62430b8776fad571bd06cf10cc2ba0aba031685c","observation_id":"76d86c79-9ba3-471e-ae7f-c9e467fe44df","resolution":{"observed_at":"2026-08-07T14:36:28.109772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-07T14:36:28.168443Z","title":"SVD-LLM: Truncation-aware singular value decomposition for large language model compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.168443Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:0f0f4ba66d690fb0bb975becc3918d3e98fb0a97326ed43735b5a293d24d0102","observation_id":"603ecd6f-dbb6-4f96-bcc4-d59ffd567631","resolution":{"observed_at":"2026-08-07T14:36:28.168443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T14:36:28.207771Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.207771Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:9a6101467806c02b2a490cc172e40bf03d6fbb46bd8146148d7d01442c2dc2e2","observation_id":"7c9bb04e-07e6-4706-9bff-98ca4f8da6a1","resolution":{"observed_at":"2026-08-07T14:36:28.207771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T14:36:28.266940Z","title":"Huggingface’s transformers: State-of-the-art natu- ral language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.266940Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:dab595c5acf19ad4cb325d7552c2eb70c6fec3434e62868a4cabe77b57261c65","observation_id":"34cbf179-46fa-4b85-84a3-6ce0b858f452","resolution":{"observed_at":"2026-08-07T14:36:28.266940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.631147Z","title":"A survey on model com- pression and acceleration for pretrained language models","venue":null,"work_id":"160d3738-caa0-4a95-89f4-0b76b7396bb8","year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.327746Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:af3d9d4a1deea881c8900be69eb9f2d46856ec37ee957d162cbf9b38e1d03744","observation_id":"bb1f7871-a812-4f81-ac68-d52ca000203e","resolution":{"observed_at":"2026-08-07T14:36:29.690027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05223","last_updated":"2025-03-07T21:18:41Z","snapshot_observed_at":"2026-07-06T18:27:20.236336Z","submitted_at":"2024-06-07T19:10:35Z","title":"CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05223","snapshot_observed_at":"2026-08-07T14:36:28.399010Z","title":"CorDA: Context-oriented decomposition adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.399010Z"},"links":{"cited_paper":"/paper/2406.05223","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:4dc6b99e20a16330130aa3724adb6194358e86dd8320b5143b252f1a8b145cb2","observation_id":"657eba76-ddd8-4c71-9aa4-d7ed7b2be546","resolution":{"observed_at":"2026-08-07T14:36:28.399010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.509919Z","title":"ZeroQuant: Ef- ficient and affordable post-training quantization for large- scale transformers","venue":null,"work_id":"ad6d6dcb-e77a-4d03-9401-617721909678","year":2022},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.478865Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:9f02dc011f7f64edc57536beb874fb4420b6f9d6577f19a91fac20b11526797b","observation_id":"9657a837-80cd-4eb0-91fc-86a062381182","resolution":{"observed_at":"2026-08-07T14:36:29.560048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-07T14:36:28.526259Z","title":"ASVD: Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.526259Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:c80f19fb671794fd28a5dfabc2132f4faadcb41e3e8bfeb94fb1bd81f8994294","observation_id":"58b88554-8138-461b-adcc-18dfbad1c2d7","resolution":{"observed_at":"2026-08-07T14:36:28.526259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:36:28.556122Z","title":"LLM inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.556122Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:554267b9508ae8ae8e4312077fbd8d773e8b9f513f977c1b393fe830ae6be869","observation_id":"b93a57aa-0a94-4728-8bc8-8f5214d49e12","resolution":{"observed_at":"2026-08-07T14:36:28.556122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T14:36:28.641006Z","title":"OPT: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.641006Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:6686c9a35b4baafa4d712d35e4599a519f24b77a552c62a2751e91a06e87ae01","observation_id":"26e09b5b-3bc5-445f-a80e-64b3cbf75517","resolution":{"observed_at":"2026-08-07T14:36:28.641006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.343652Z","title":"C 1 2 O µ⊤C −1 2 (1 − µ⊤C +µ) 1 2 #","venue":null,"work_id":"4e1daaa7-87c9-486f-9a69-bb170b985f9b","year":2024},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.682828Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:d95695fff2edfc13de82b378930c5e6b0688b73112127d5f2ceb1e3fccb2a256","observation_id":"242077bb-9032-41fe-a6f4-4057b8020261","resolution":{"observed_at":"2026-08-07T14:36:29.428122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:36:29.211565Z","title":"(193) Plugging into the loss gives: L = X i ∥Wo,iWv,i(X − µ1⊤) − ˆWo,i ˆWv,i(X − µ1⊤)∥2 (194) = X i ∥ Wo,iWv,i| {z } Gi∈Rd×d C 1 2 0 − Bo Ao,iBv,i| {z } Hi∈Rro ×rv AvC 1 2 0 ∥2","venue":null,"work_id":"f9d16949-ca52-4ab0-9a1d-1ebde381505f","year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.735305Z"},"links":{"citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:8f7546445e1e3ed82201cb1fbd0174a6d68f4489a0c345d97574a4569108f012","observation_id":"235a3222-a37a-4581-91b0-6192fddafa9c","resolution":{"observed_at":"2026-08-07T14:36:29.249964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2505.18413."}