Artificial Analysis evalúa modelos pequeños para inferencia móvil

Artificial Analysis ha lanzado un sistema de benchmarking especializado en la inferencia de modelos de inteligencia artificial a escala de bolsillo, diseñados específicamente para ejecutarse en teléfonos móviles. Esta iniciativa técnica busca medir el rendimiento real de los modelos pequeños, defini

Cómo scheme-rs multiplicó por 25 su rendimiento con tres optimizaciones

scheme-rs es una implementación de Scheme escrita en Rust cuyo autor decidió el 31 de diciembre de 2024 transformar su intérprete basado en AST en un compilador JIT con representación intermedia en CPS (Continuation-Passing Style). El objetivo principal era hacer mecánica la creación de continuacion

Trampas del benchmarking en sistemas modernos: por qué los resultados engañan

Benchmarking en sistemas modernos rara vez produce datos limpios y comparables. Aunque el software bajo prueba sea determinista, el resto del entorno —sistema operativo, hardware, JVM, mecanismos de seguridad— introduce variaciones que pueden cambiar los tiempos de ejecución entre iteraciones y entr

Una solución sencilla para la latencia de cola en los LLM

Reducir la latencia de cola en los productos conversacionales basados en modelos de lenguaje no requiere necesariamente pagar el doble por un nivel de servicio prioritario. La empresa HOAi, que desarrolla agentes de voz que atienden llamadas telefónicas, experimentó con una alternativa más barata: e

Qwen3.8 27B: análisis de inteligencia, rendimiento y precio

Qwen3.8 27B es un modelo de inteligencia artificial de pesos abiertos desarrollado por Alibaba, con 27.000 millones de parámetros y licencia Apache 2.0, lo que permite su uso comercial y su autoalojamiento. La versión analizada en esta ficha es la variante con razonamiento (chain-of-thought), capaz

El proyecto curl estrena un sistema público de pruebas de rendimiento

El equipo de curl ha puesto en marcha un sistema público y automatizado de pruebas de rendimiento, accesible desde curl.se/perf/, que reconstruye el proyecto cada veinte minutos a partir del último commit de git y mide métricas como velocidad de descarga de un archivo de 100 GB desde localhost, núme

Rust sin bifurcaciones: un filtro 4 veces más rápido al eliminar un 'if'

El programador Serhii Potapov (greyblake) demuestra cómo una técnica de programación sin bifurcaciones (branchless) puede acelerar hasta cuatro veces el típico filtrado de un millón de valores de tipo f64 en Rust. El artículo parte de un caso aparentemente trivial: una función `filter` que conserva

build2 iguala e incluso supera a Ninja en velocidad de compilación

El desarrollador del sistema de compilación build2 presenta una comparativa de rendimiento frente a Ninja, considerado la referencia de velocidad en builds de C++. Para una prueba en igualdad de condiciones eligió Xerces-C++, un parser XML en C++ con 299 unidades de traducción, y realizó una compila

Comparativa de modelos de IA: inteligencia, velocidad y precio en 164 modelos

La plataforma Artificial Analysis publica una comparativa exhaustiva de modelos de inteligencia artificial que evalúa, sobre 164 modelos (93 de pesos abiertos y 120 con razonamiento), seis dimensiones clave: calidad de las respuestas, precio, velocidad de salida en tokens por segundo, latencia hasta

Geekbench 7 llega con pruebas más exigentes para CPU y GPU y soporte para AV1

Primate Labs ha presentado Geekbench 7, la nueva generación de su popular herramienta de benchmarking sintético, que incorpora conjuntos de datos más grandes y exigentes para CPU y GPU, pruebas de codificación y decodificación de vídeo y audio inéditas y un test multinúcleo rediseñado. La versión ma

Elige bytes, no FLOPs: cómo reescribir el camino caliente de un bootstrap

El equipo de tsbootstrap detectó, en una comparativa frente a la librería econométrica arch, que su motor de bootstrap por bloques era varias veces más lento en cargas realistas. El problema no era el intérprete: era estructural. La implementación previa materializaba todas las réplicas en un único

EF Core 11 optimiza las consultas divididas al eliminar JOINs innecesarios

EF Core 11 introduce una optimización que mejora el rendimiento de las consultas que usan AsSplitQuery. Por defecto, Entity Framework Core carga los datos en una sola consulta, pero al incluir colecciones mediante Include genera JOINs que duplican filas del padre. AsSplitQuery resuelve ese problema

Guía para dimensionar PostgreSQL en instancias EC2 de AWS

Dimensionar correctamente un servidor PostgreSQL en AWS requiere equilibrar el tamaño del conjunto de datos, la carga de trabajo y el coste por hora de cada instancia EC2. Esta herramienta permite fijar el volumen de datos y el rendimiento deseado (transacciones por segundo) para que el sistema reco

Alineación contra el falso compartimiento: 64 o 128 bytes

El falso compartimiento (false sharing) es un fenómeno de rendimiento que ocurre cuando dos variables atómicas independientes caen dentro de la misma línea de caché. Aunque los protocolos de coherencia como MESI trabajan con bloques del tamaño de una línea de caché y no con direcciones individuales,

El benchmarking como nueva forma de activar datos en IA

Construir y aplicar benchmarks se ha convertido en una forma de activación de datos: convierte información de un dominio en superficies contra las que se puede medir, clasificar y entrenar modelos de lenguaje. El artículo parte de una observación: los grandes modelos mejoran más rápido allí donde ex

Patrones de acceso a memoria que enfurecen a tu CPU

Este artículo analiza de forma experimental cómo distintos patrones de acceso a memoria pueden degradar el rendimiento de una CPU al sumar los elementos de un arreglo de 2^26 enteros sin signo de 32 bits. La medición se realiza con el contador de ciclos rdtsc sobre un Intel Core Ultra 7 268V, con hu

Benchmark en Go: un mapa fragmentado con 256 cerrojos supera al resto

Este artículo presenta una comparativa exhaustiva de seis diseños de caché en memoria (pares clave-valor de cadenas) implementados exclusivamente con la biblioteca estándar de Go y evaluados con pruebas de rendimiento. Los diseños comparados son: un mapa plano sin protección (no seguro), un mapa con

Qwen local frente a Opus: una herramienta distinta, no inferior

Un fundador y mantenedor de software comparte su experiencia de uso continuado con modelos Qwen locales (27B y 35-A3B) en su empresa, que mantiene proyectos como OpenFaaS, SlicerVM, Actuated e Inlets, todos escritos en Go y centrados en infraestructura. El autor matiza la afirmación de que Qwen loca

Lecciones de orquestar 100.000 sandboxes concurrentes

Scale, una empresa de evaluación de infraestructura en la nube, pospuso la publicación de los resultados de su "Scale Invitational" del 8 al 17 de junio tras descubrir, durante el diseño de la prueba, problemas de fondo que invalidaban sus primeras mediciones. El benchmark busca comparar proveedores

Los problemas de usar UUID aleatorios como clave primaria en SQLite

Las bases de datos recurren con frecuencia a UUID aleatorios como clave primaria por su unicidad distribuida, pero esta elección tiene un coste de rendimiento que muchos desarrolladores desconocen. En SQLite, cada tabla ordinaria dispone de un rowid implícito de 64 bits que actúa como índice agrupad

El problema oculto de Go: abstracciones que ralentizan el código crítico

Este artículo explora un problema fundamental en la optimización de rendimiento en Go: la ausencia de abstracciones de costo cero en las rutas críticas de código (hot paths). El autor, al portar el algoritmo Brotli a Go puro para el proyecto go-brrr, descubrió que las abstracciones idiomáticas del l

Red Hat critica estudio de VMware: Comparación injusta

Red Hat ha cuestionado un estudio publicado por VMware que afirmaba que VMware Cloud Foundation (VCF) 9.0 con vSphere Kubernetes Service (VKS) ofrece una ventaja de “5.6x pod density” sobre Red Hat OpenShift. Según Red Hat, el estudio presenta una comparación metodológicamente defectuosa, ya que uti

Glass Cannon: Generador de carga HTTP ultra rápido

Se ha lanzado 'Glass Cannon', un nuevo generador de carga HTTP/1.1 y WebSocket de alto rendimiento, diseñado para pruebas de estrés y rendimiento de servidores web. Desarrollado para [Http Arena](https://www.http-arena.com/), Glass Cannon se distingue por su velocidad, aprovechando la tecnología 'io

Intel optimiza código, afecta resultados de Geekbench

Intel ha implementado una herramienta de optimización binaria (BOT) que modifica el código de ciertas aplicaciones para mejorar su rendimiento, incluyendo versiones específicas de la prueba de rendimiento Geekbench. Según un análisis realizado por Geekbench, BOT introduce un retraso inicial de 40 se

Procesadores 'aprenden': Impacto en pruebas de rendimiento

Un nuevo análisis revela la capacidad de los procesadores modernos para aprender y predecir patrones de ejecución, lo que afecta significativamente la precisión de las pruebas de rendimiento (benchmarking). Daniel Lemire, investigador y experto en rendimiento de software, ha descubierto que los proc

LLMs aprueban prueba, pero no siempre sirven al código

Este informe de METR analiza la discrepancia entre los resultados de los modelos de lenguaje grandes (LLMs) en el benchmark SWE-bench Verified y su utilidad real en proyectos de código abierto. SWE-bench Verified es una herramienta para evaluar la capacidad de los LLMs para resolver problemas de pro

Apple M5 Max: ¿Rendimiento inflado en pruebas?

Un artículo de Tom's Hardware ha generado controversia al afirmar que el chip Apple M5 Max, con 18 núcleos, supera a un procesador AMD Ryzen Threadripper Pro de 96 núcleos en pruebas Geekbench 6. Sin embargo, según un análisis publicado en dev.to y señalado por el usuario Ecuador en Slashdot, los re

LLMs se enfrentan en juegos: nueva prueba de inteligencia

Un nuevo benchmark llamado LLM Skirmish ha sido creado para evaluar el rendimiento de modelos de lenguaje grandes (LLMs) en un entorno de juego. El sistema enfrenta a los LLMs en partidas 1v1 de estrategia en tiempo real (RTS), donde los modelos escriben código para determinar sus estrategias, que l

Go 1.24: sync.Map optimizado con nueva estructura

A partir de Go 1.24, la implementación interna de `sync.Map` en la biblioteca estándar de Go ha sido rediseñada para mejorar el rendimiento de la concurrencia, utilizando ahora una estructura llamada HashTrieMap. Esta estructura combina una tabla hash con un trie, permitiendo lecturas sin bloqueo (l

Typst lidera: análisis revela sorpresas en motores PDF

Un análisis comparativo de seis motores PDF ha revelado resultados inesperados, según un desarrollador de Speedata, quien los utilizó para su propio motor de tipografía. El estudio, realizado en una MacBook Air M4, evaluó el rendimiento de speedata Publisher (sp), Typst, pdflatex, LuaLaTeX, WeasyPri

IA en el Navegador: Ejecuta Modelos GGUF sin Nube

MDST ha lanzado una nueva herramienta que permite ejecutar modelos de lenguaje grandes (LLMs) en formato GGUF directamente en el navegador web, sin necesidad de depender de proveedores de la nube o configuraciones complejas. Esta innovación, impulsada por WebGPU, abre la puerta a un acceso más ampli

ElysiaJS: Nuevo Framework Bate Récords de Velocidad

ElysiaJS, un framework web de nueva generación, ha demostrado un rendimiento significativamente superior a otros frameworks populares como Express y Fastify, según los resultados de la prueba TechEmpower Benchmark Round 22 (publicados el 17 de octubre de 2023). Utilizando un compilador JIT (Just-In-